AI エージェントの性能はモデルより『制御フレームワーク』で決まる——Nvidia 研究
Nvidiaが発表した研究では、AIエージェントの性能を決めるのは「モデルの出来」ではなく「制御フレームワーク(harness)」だことを示した。実験はシンプルだ。Claude Opus 5に従来のフレームワークを当てると成績は30%だったが、メモリ管理を改善し「スーパーバイザー」という監督役のコンポーネントを加えた独自フレームワークを当てると100%に跳ね上がった。対象となったARC-AGI-3という謎解きゲームのベンチマークは、OpenAIですら10%未満だった。つまりモデルではなく制御の工夫が全てを決めるという実験結果だ。
これまで企業がAIの性能を高めるとき、最新モデル導入ばかり考えてきた。高いカネを払ってGPT最新版やClaude最新版を入れれば自動的に速くなると思い込んでいた。しかし実態は異なる。モデルは「頭」に過ぎず、その頭を生かすための「身体と神経」がフレームワークなのだ。スーパーバイザーという監督役がエージェントの迷いに軌道修正を加え、記憶の使い方を工夫し、チェックポイントを配置する。その細かい工夫の積み重ねが30%と100%の差を生む。競争軸は「誰が最新モデルか」から「誰が最優秀なフレームワークを設計できるか」にシフトしたのだ。
中小製造業がAIエージェントを現場に入れるとき、「モデル選び」ではなく「フレームワーク設計」に人数と時間を割く必要がある。設定段階で、エージェントが迷ったときの判断基準、メモリの管理方法、チェックポイント配置を自社業務に合わせて作り込む。その手間を惜しんで既製品のデフォルト設定で回すと、モデルが有能でも成果は出ない。フレームワークこそがAIを使い倒す鍵なのだ。
※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。
このニュースの全文は、配信元でお読みいただけます。 TechCrunch AIで元記事を読む →


