ニュース › Google DeepMind #新モデル Google DeepMind 2025年11月18日 Gemini 3が拓く知能の新時代 イメージ このニュースの全文は、配信元でお読みいただけます。 Google DeepMindで元記事を読む → 編集部の実践記録から 当社が自社の業務でAIを動かし、処理件数・所要時間・失敗件数まで 実際に測った記録です。 AI解体新書 なぜ高性能モデルに丸投げすると失敗するのか?トークン30分の1・成功率1桁台から80%超という報告の読み方 IBM Researchが、業務AIをLLM単体ではなく従来型ソフト部品で誘導する「エージェントロジック」で組み直したところ、トークン消費が最大30分の1、成功率が1桁台から80%超に改善したと報告しました。数字の条件と、自社製品の提供者による発表という前提を踏まえ、中小企業が投資すべき場所を整理します。 続きを読む → AI解体新書 音声AIエージェントは正答率だけで選んでよいのか——50シナリオ・20システムの評価が示したもの ServiceNowが公開した音声エージェント評価フレームワークEVAは、航空会社ドメインの英語50シナリオ・15ツール・20システムを対象に、精度(EVA-A)と会話体験(EVA-X)を別々に測りました。全構成でこの2つがトレードオフになったという報告を、中小企業の選定手順にどう落とすかを整理します。 続きを読む → AI解体新書 業務AIエージェントの「成功率」だけ見ていると、なぜ改善できないのか — 310トレースを失敗の型で数え直した結果 IBM Research と UC Berkeley が、IT運用タスクを実行したAIエージェントの実行トレース310本を「失敗の型」で分類しました。失敗した実行1回には平均2.6〜5.3個の問題が同時に起きており、成功率という単一の数字が改善の役に立たない理由が数字で示されています。中小企業がPoCの評価条件をどう書くべきかまで整理します。 続きを読む →
AI解体新書 なぜ高性能モデルに丸投げすると失敗するのか?トークン30分の1・成功率1桁台から80%超という報告の読み方 IBM Researchが、業務AIをLLM単体ではなく従来型ソフト部品で誘導する「エージェントロジック」で組み直したところ、トークン消費が最大30分の1、成功率が1桁台から80%超に改善したと報告しました。数字の条件と、自社製品の提供者による発表という前提を踏まえ、中小企業が投資すべき場所を整理します。 続きを読む →
AI解体新書 音声AIエージェントは正答率だけで選んでよいのか——50シナリオ・20システムの評価が示したもの ServiceNowが公開した音声エージェント評価フレームワークEVAは、航空会社ドメインの英語50シナリオ・15ツール・20システムを対象に、精度(EVA-A)と会話体験(EVA-X)を別々に測りました。全構成でこの2つがトレードオフになったという報告を、中小企業の選定手順にどう落とすかを整理します。 続きを読む →
AI解体新書 業務AIエージェントの「成功率」だけ見ていると、なぜ改善できないのか — 310トレースを失敗の型で数え直した結果 IBM Research と UC Berkeley が、IT運用タスクを実行したAIエージェントの実行トレース310本を「失敗の型」で分類しました。失敗した実行1回には平均2.6〜5.3個の問題が同時に起きており、成功率という単一の数字が改善の役に立たない理由が数字で示されています。中小企業がPoCの評価条件をどう書くべきかまで整理します。 続きを読む →