25万トークンは確かに大きいですね。100万トークン(約75万字)なら、ほとんどの実用場面では十分すぎるほどです。「コンテキスト長が限られる」というのは、以下のような文脈で言われることが多いです:
• 巨大なコードベース全体を一度に読み込みたい場合:大規模プロジェクトの全ソースコード(数十万行)を一度に渡すには100万でも足りない可能性
• 長時間の会話履歴:何日も続くチャットやログを全部保持したい場合
• 大量ドキュメントの同時処理:数百のPDFやレポートをまとめて分析する場合
ただし、実際には「コンテキスト長が長い=良い」というわけではなく:
• 計算コストとメモリ使用量が比例して増える
• モデルが本当に長い文脈全体を効果的に利用できているかは別問題(「真ん中の忘却」現象)
• 適切なプロンプト設計や分割処理で、より短いコンテキストでも同等の結果を得られる場合が多い
100万トークンにすれば、ローカルLLMでのプログラミング支援もかなり実用的になるはずです。ただし、それ以上に期待しすぎると失望するかもしれません。