ニュース › Hugging Face #研究動向 Hugging Face 2026年8月19日 量子化認識蒸留による LFM2.5 Q4_0 チェックポイント イメージ このニュースの全文は、配信元でお読みいただけます。 Hugging Faceで元記事を読む → 編集部の実践記録から 当社が自社の業務でAIを動かし、処理件数・所要時間・失敗件数まで 実際に測った記録です。 AI解体新書 手順書を足せばAIエージェントは賢くなるのか?正答率67%→43%、あるタスクでは100%→0%になった記録 Hugging Faceが自社ツール上でオープンモデルのエージェント能力を3段階の構成で測ったところ、手順書(Skill)を同梱した構成で小型モデルの一致率が67%から43%に落ち、あるタスクでは100%から0%になりました。同じ作業のトークン消費が約2,400から約23,000へ振れた例もあります。中小企業がPoCで何を測るべきかを整理します。 続きを読む → AI解体新書 なぜ高性能モデルに丸投げすると失敗するのか?トークン30分の1・成功率1桁台から80%超という報告の読み方 IBM Researchが、業務AIをLLM単体ではなく従来型ソフト部品で誘導する「エージェントロジック」で組み直したところ、トークン消費が最大30分の1、成功率が1桁台から80%超に改善したと報告しました。数字の条件と、自社製品の提供者による発表という前提を踏まえ、中小企業が投資すべき場所を整理します。 続きを読む → AI解体新書 音声AIエージェントは正答率だけで選んでよいのか——50シナリオ・20システムの評価が示したもの ServiceNowが公開した音声エージェント評価フレームワークEVAは、航空会社ドメインの英語50シナリオ・15ツール・20システムを対象に、精度(EVA-A)と会話体験(EVA-X)を別々に測りました。全構成でこの2つがトレードオフになったという報告を、中小企業の選定手順にどう落とすかを整理します。 続きを読む →
AI解体新書 手順書を足せばAIエージェントは賢くなるのか?正答率67%→43%、あるタスクでは100%→0%になった記録 Hugging Faceが自社ツール上でオープンモデルのエージェント能力を3段階の構成で測ったところ、手順書(Skill)を同梱した構成で小型モデルの一致率が67%から43%に落ち、あるタスクでは100%から0%になりました。同じ作業のトークン消費が約2,400から約23,000へ振れた例もあります。中小企業がPoCで何を測るべきかを整理します。 続きを読む →
AI解体新書 なぜ高性能モデルに丸投げすると失敗するのか?トークン30分の1・成功率1桁台から80%超という報告の読み方 IBM Researchが、業務AIをLLM単体ではなく従来型ソフト部品で誘導する「エージェントロジック」で組み直したところ、トークン消費が最大30分の1、成功率が1桁台から80%超に改善したと報告しました。数字の条件と、自社製品の提供者による発表という前提を踏まえ、中小企業が投資すべき場所を整理します。 続きを読む →
AI解体新書 音声AIエージェントは正答率だけで選んでよいのか——50シナリオ・20システムの評価が示したもの ServiceNowが公開した音声エージェント評価フレームワークEVAは、航空会社ドメインの英語50シナリオ・15ツール・20システムを対象に、精度(EVA-A)と会話体験(EVA-X)を別々に測りました。全構成でこの2つがトレードオフになったという報告を、中小企業の選定手順にどう落とすかを整理します。 続きを読む →