Claude Codeのトークン消費、92〜97%は「文脈の再読」だった——読み取り専用DeepSeekワーカーを作って実測99%削減した
Claude Code ユーザーがすべてのセッション記録を集計し、トークン消費の内訳を分析した。結果は予想外だった:92~97%がキャッシュの読み書き、すなわち毎ターン文脈を再読む処理に消えている。思考トークン(Deep Research や長時間の推論)は全体の0.4%に過ぎない。さらにマルチエージェント構成では、88~93%が「読むだけ」のサブエージェントで費やされている。つまり、フロンティアモデルの最大の無駄は「能力の高い推論をさせること」ではなく「同じ文脈を何度も読ませること」だったのだ。
対策として著者は、DeepSeek V4 Flash を読み取り専用の自律ワーカーとしてMCPサーバ化した。glob・grep・read_file・web_search を自前ループで回し、圧縮レポート(12k文字程度)だけを返す設計だ。重要な点は、ワーカーが読んだファイルはメインモデルの文脈に入らないこと。1M トークン読んでも返るのは数千トークルのレポートだけなので、以後のターンで「再読」されるのはレポートだけになる。実測で同種タスクが$392から$4.5へ、つまり99%の削減を実現した。これは「どのモデルが強いか」という議論とは別の、「そもそもアーキテクチャをどう設計するか」という判断の転換である。
「AIエージェントは費用が高い」という懸念は広い。だが本記事の教訓は明確だ:全部をフロンティアモデルにやらせるな。データ収集はDeepSeek、意思決定は Claude といった役割分業を最初から設計すれば、月々のAI費用は劇的に圧縮できる。特に社内ナレッジの検索・集計・要約といった「読むだけの仕事」は、安価なモデルに任せるべき土台が見えた。
※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →


