マジレスするとローカルでアーキテクチャまで開発して忘れない(RAG的な拡張検索システム)作るのは全くダメ

自分でRAG作ってマックスタジオ512GBメモリで運用してるけど、「RAGでの検索、LLMでの推論」を同時に同じCPU, GPU回路で走らせると遅すぎる

ちなみに同じようなシステムを5090x2枚のリナックスで組んでるけどそれでも遅い

マックスタジオでローカルAIやってて一番頭にくるポイントがスケーラブルじゃない点なんで、スケールすなわちレイテンシー求めるならクラウド一択。5年後ぐらい見据えるなら恐らくアップル・インテリジェンスのサービスになると思う。グーグルのジェミニ3使うらしいし

今すぐやりたいならアマゾンのベッドロックか、アジュールのファウンドリーIQでC#かPythonで組むのがおすすめだ。データベースでのベクトル検索と推論は分なきゃやってられる