ニュース › Hugging Face Hugging Face 2026年2月12日 OpenEnv in Practice: Evaluating Tool-Using Agents in Real-World Environments イメージ このニュースの全文は、配信元でお読みいただけます。 Hugging Faceで元記事を読む → 編集部の実践記録から 当社が自社の業務でAIを動かし、処理件数・所要時間・失敗件数まで 実際に測った記録です。 AI解体新書 AIエージェントは設備の現場業務をどこまで任せられるのか?最良モデルでも計画68.2%・実行72.4%、複数連携では47% IBM Researchが公開したAssetOpsBenchは、産業設備の運用業務をAIエージェントに解かせるベンチマークです。最良のGPT-4.1でも計画68.2%・実行72.4%にとどまり、実運用可否の基準である85点に到達したモデルはゼロ。複数エージェントを連携させると47%まで落ちました。中小企業が自動化の範囲を決める材料になります。 続きを読む → AI解体新書 公開ベンチマークのスコアはそのまま比較に使えるのか?同じLLaMA 65BのMMLUが63.7と48.8に割れている Hugging FaceとEvalEval Coalitionが、22,000超のモデル・2,200のベンチマークにまたがる229,000件の評価結果を1か所に集約しました。そこで露わになったのは、同一モデル・同一ベンチマークでもスコアが63.7と48.8に食い違うという事実です。ベンダー提示の点数をどう扱うべきかを整理します。 続きを読む → AI解体新書 リリース間隔が4〜6週から毎週へ短縮した事例で、AIエージェントにどこまで任せてどこに人を残すべきか? Hugging Faceが自社ライブラリのリリース作業をAIで自動化し、4〜6週に1回だったリリースを毎週1回に、人手のレビューを数時間から約15分に短縮したと公表しました。1回あたりのAI利用コストは約0.25ドル。自社サービスの利用事例という利害関係も含めて、中小企業が持ち帰れる設計思想を整理します。 続きを読む →
AI解体新書 AIエージェントは設備の現場業務をどこまで任せられるのか?最良モデルでも計画68.2%・実行72.4%、複数連携では47% IBM Researchが公開したAssetOpsBenchは、産業設備の運用業務をAIエージェントに解かせるベンチマークです。最良のGPT-4.1でも計画68.2%・実行72.4%にとどまり、実運用可否の基準である85点に到達したモデルはゼロ。複数エージェントを連携させると47%まで落ちました。中小企業が自動化の範囲を決める材料になります。 続きを読む →
AI解体新書 公開ベンチマークのスコアはそのまま比較に使えるのか?同じLLaMA 65BのMMLUが63.7と48.8に割れている Hugging FaceとEvalEval Coalitionが、22,000超のモデル・2,200のベンチマークにまたがる229,000件の評価結果を1か所に集約しました。そこで露わになったのは、同一モデル・同一ベンチマークでもスコアが63.7と48.8に食い違うという事実です。ベンダー提示の点数をどう扱うべきかを整理します。 続きを読む →
AI解体新書 リリース間隔が4〜6週から毎週へ短縮した事例で、AIエージェントにどこまで任せてどこに人を残すべきか? Hugging Faceが自社ライブラリのリリース作業をAIで自動化し、4〜6週に1回だったリリースを毎週1回に、人手のレビューを数時間から約15分に短縮したと公表しました。1回あたりのAI利用コストは約0.25ドル。自社サービスの利用事例という利害関係も含めて、中小企業が持ち帰れる設計思想を整理します。 続きを読む →