AIの鬼
#新モデル Zenn AI

Claude Codeのトークン消費、92〜97%は「文脈の再読」だった——読み取り専用DeepSeekワーカーを作って実測99%削減した

Claude Codeのトークン消費、92〜97%は「文脈の再読」だった——読み取り専用DeepSeekワーカーを作って実測99%削減した(内容を表す図ではないイメージ画像)
イメージ

Claude Code ユーザーがすべてのセッション記録を集計し、トークン消費の内訳を分析した。結果は予想外だった:92~97%がキャッシュの読み書き、すなわち毎ターン文脈を再読む処理に消えている。思考トークン(Deep Research や長時間の推論)は全体の0.4%に過ぎない。さらにマルチエージェント構成では、88~93%が「読むだけ」のサブエージェントで費やされている。つまり、フロンティアモデルの最大の無駄は「能力の高い推論をさせること」ではなく「同じ文脈を何度も読ませること」だったのだ。

対策として著者は、DeepSeek V4 Flash を読み取り専用の自律ワーカーとしてMCPサーバ化した。glob・grep・read_file・web_search を自前ループで回し、圧縮レポート(12k文字程度)だけを返す設計だ。重要な点は、ワーカーが読んだファイルはメインモデルの文脈に入らないこと。1M トークン読んでも返るのは数千トークルのレポートだけなので、以後のターンで「再読」されるのはレポートだけになる。実測で同種タスクが$392から$4.5へ、つまり99%の削減を実現した。これは「どのモデルが強いか」という議論とは別の、「そもそもアーキテクチャをどう設計するか」という判断の転換である。

「AIエージェントは費用が高い」という懸念は広い。だが本記事の教訓は明確だ:全部をフロンティアモデルにやらせるな。データ収集はDeepSeek、意思決定は Claude といった役割分業を最初から設計すれば、月々のAI費用は劇的に圧縮できる。特に社内ナレッジの検索・集計・要約といった「読むだけの仕事」は、安価なモデルに任せるべき土台が見えた。

※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。

御社でもAIを使ってみませんか
まずはここから 御社でもAIを使ってみませんか? 御社の実際の業務を題材に、AIで何ができるかを一緒に考えます。 「ChatGPTの使い方」を教えるだけの研修ではありません。 AI研修・AI活用相談 →