ニュース › Google DeepMind Google DeepMind 2026年4月22日 Decoupled DiLoCo、分散AI学習の新展開 画像: Google DeepMind(配信元より) このニュースの全文は、配信元でお読みいただけます。 Google DeepMindで元記事を読む → 編集部の実践記録から 当社が自社の業務でAIを動かし、処理件数・所要時間・失敗件数まで 実際に測った記録です。 AI解体新書 AIエージェントへの指示は「会議ID」と「来週の営業会議」で成功率がどれだけ変わるのか?約90%と約40% OpenEnvのCalendar Gym環境で、AIエージェントのタスク成功率は対象を識別子(ID)で明示した場合に約90%、同じタスクを自然言語で表現した場合に約40%でした。失敗の半数超はツール引数の書式ミスか実行順序の誤りです。発信元はこの評価環境の提供者であり、n数や評価モデル名は開示されていません。 続きを読む → AI解体新書 大きいモデルなら自社の言葉も通じるのか?1,173問・54モデルで正答率が25.66%〜82.18%に開いた検証 UAEのTechnology Innovation Instituteが、エミラティ方言を扱う1,173問のベンチマーク「Alyah」で54モデルを評価しました。同じ問題セットで正答率は25.66%から82.18%まで開き、4択の偶然正解25%と区別できないモデルもありました。自社の言葉づかいで測る必要性を示す実例です。 続きを読む → AI解体新書 AIエージェントは設備の現場業務をどこまで任せられるのか?最良モデルでも計画68.2%・実行72.4%、複数連携では47% IBM Researchが公開したAssetOpsBenchは、産業設備の運用業務をAIエージェントに解かせるベンチマークです。最良のGPT-4.1でも計画68.2%・実行72.4%にとどまり、実運用可否の基準である85点に到達したモデルはゼロ。複数エージェントを連携させると47%まで落ちました。中小企業が自動化の範囲を決める材料になります。 続きを読む →
AI解体新書 AIエージェントへの指示は「会議ID」と「来週の営業会議」で成功率がどれだけ変わるのか?約90%と約40% OpenEnvのCalendar Gym環境で、AIエージェントのタスク成功率は対象を識別子(ID)で明示した場合に約90%、同じタスクを自然言語で表現した場合に約40%でした。失敗の半数超はツール引数の書式ミスか実行順序の誤りです。発信元はこの評価環境の提供者であり、n数や評価モデル名は開示されていません。 続きを読む →
AI解体新書 大きいモデルなら自社の言葉も通じるのか?1,173問・54モデルで正答率が25.66%〜82.18%に開いた検証 UAEのTechnology Innovation Instituteが、エミラティ方言を扱う1,173問のベンチマーク「Alyah」で54モデルを評価しました。同じ問題セットで正答率は25.66%から82.18%まで開き、4択の偶然正解25%と区別できないモデルもありました。自社の言葉づかいで測る必要性を示す実例です。 続きを読む →
AI解体新書 AIエージェントは設備の現場業務をどこまで任せられるのか?最良モデルでも計画68.2%・実行72.4%、複数連携では47% IBM Researchが公開したAssetOpsBenchは、産業設備の運用業務をAIエージェントに解かせるベンチマークです。最良のGPT-4.1でも計画68.2%・実行72.4%にとどまり、実運用可否の基準である85点に到達したモデルはゼロ。複数エージェントを連携させると47%まで落ちました。中小企業が自動化の範囲を決める材料になります。 続きを読む →