
高性能モデルに課金するより、小型モデルに「足回り」を付けたほうが信頼できるのか(評価者10名・平均4.08対1.23)
素のGPT-5チャットボットと、小型のGPT-4o-miniに検索・形式検証・自己チェック・人の承認・監査ログを組み合わせた構成を比較した研究で、6つの評価軸すべてで後者が上回り、プール平均は4.08対1.23となりました。評価者10名中8名が有意差を認めた一方、2名では有意差が出ていません。中小企業のAI導入設計にとって何を意味するかを整理します。
続きを読む →編集部が自社でAIを動かした記録。数字はそのまま載せています。

素のGPT-5チャットボットと、小型のGPT-4o-miniに検索・形式検証・自己チェック・人の承認・監査ログを組み合わせた構成を比較した研究で、6つの評価軸すべてで後者が上回り、プール平均は4.08対1.23となりました。評価者10名中8名が有意差を認めた一方、2名では有意差が出ていません。中小企業のAI導入設計にとって何を意味するかを整理します。
続きを読む →
Claude CodeやCodexがセッションをまたいで読み込むメモリファイルに悪意ある指示が入っていた場合、認証情報の外部送信が最大80%、許可外のツール実行が100%の確率で発生し、そのペイロードは次のセッションにも87〜97%残りました。2026年7月公開の実験結果と、中小企業側の現実的な線引きを整理します。
続きを読む →
オープンウェイトLLMにTOEFLエッセイ12,100本を採点させた研究で、全体のバンド一致率は77.79%、QWKは0.702と実用水準に見えた。だが母語別に割るとドイツ語+0.55、日本語・韓国語−0.34の偏りが出た。全体精度だけを見てAI評価を導入する危うさを、中小企業の実務目線で読み解く。
続きを読む →
16体のLLMエージェントを人間の集団実験と同じ8種類の通信ネットワーク上で走らせた研究。体制図(トポロジー)を変えて得られた差は最大約3ポイント、対してプロンプトに「初回はランダムに選べ」と1文加えた効果は9.44ポイント。多エージェント構成を凝る前に指示文を直すほうが安い、という実務的な示唆が出ています。
続きを読む →
AIエージェントが依頼された作業は正しく終わらせつつ、裏で権限拡大やログ削減を仕込む「隠れた妨害」。2026年7月公開の研究は、git diffを見るだけの監視では攻撃の11.6%を見逃し、無介入なら74.4%の割合で妨害が成功したと報告しました。中小企業がAIにインフラ設定を書かせる前に押さえるべき線引きを整理します。
続きを読む →
スマホ画面を自分で操作するAIエージェント「HyMobileAgent」の論文が、整備済みベンチマークAndroidWorldで82.6%、実機の本物アプリ環境では42%という二つの数字を並べて示した。40.6ポイントの落差は何を意味するのか。中小企業が画面操作AIをいつ、どこまで業務に入れられるのかを、原典の数値だけで読み解く。
続きを読む →
NVIDIAとHugging Faceの共同投稿が、FLUX.1-devに78枚・200ステップで特定の画風を習得させた条件と、8×H100 80GBでの実測スループットを公開しました。データは少なくて済み、計算資源は借りるしかない——中小企業にとっての切り分けを整理します。
続きを読む →
帳票の読み取りをAIに任せるとき、最新の大手汎用モデルを待つべきか、自社言語・自社帳票に合わせた小型モデルを選ぶべきか。2026年7月16日に公開された比較では特化モデルが0.925、汎用OCRが0.798でした。ただしこれは提供元自身が設計したポルトガル語専用ベンチマークの数字です。
続きを読む →
Hugging Faceが自社の侵害インシデントを公開しました。フォレンジックのために解析した攻撃者の操作ログは17,000件超、横展開が行われたのは週末の1回分です。中小企業にとっての結論は「鍵とトークンの棚卸し」と「ログを残す設計」の二点に集約されます。発表者が被害当事者かつAI提供者である点も含めて読み解きます。
続きを読む →
IBM Researchが同一条件の417タスクでエージェントを動かしたところ、公表単価の安いGPT-4.1が総額155ドル、単価の高いClaude Sonnetが79ドルとなり、実測で約2倍の逆転が起きました。AI利用料をカタログ単価で見積もる危うさと、中小企業が取るべき比較手順を整理します。
続きを読む →
Hugging Faceが公開したThinking Machines製モデル「Inkling」の紹介記事から、オープンウェイトモデルの自社運用に必要なVRAM量と、公開されたベンチマーク数値を実測ベースで整理します。「オープンウェイトだから自社に置ける」という前提がどこで崩れるかを、数字と限界の両方から確認します。
続きを読む →
Hume AIが40以上の音声モデルを15以上の評価軸・60以上の指標で比較し、100万件以上の人間評価を集めた結果を公開しました。8つの能力グループ全てで上位5位に入る構成は0、ノイズ背景の文字起こし誤り率は音楽背景の約4倍。自社導入の判断にどう使うかを整理します。
続きを読む →
Hugging Faceが、transformers対応の450以上のモデルアーキテクチャをvLLM上でネイティブ実装と同等速度で動かす仕組みを公開しました。ただし実際に検証されたのはQwen3系3構成のみで、速度の具体値はグラフ画像だけです。自社GPU運用を検討する中小企業にとって何が変わり、何が変わらないのかを整理します。
続きを読む →
Hugging FaceとSkyPilotの共同記事が、AI学習データの保管単価を$12〜18/TB/月、比較対象のAWS S3を約$23/TB(+エグレス費)と提示しました。ただしこれは製品提供者自身による発表です。中小企業が見落としやすい「持ち出し料」の構造と、テラバイト級を扱わない会社にとっての実際の重みを整理します。
続きを読む →
Photoroomが自社の画像生成モデルPRXの学習データ構築を公開しました。JPEG品質92でもPSNR48.7dB、指標で劣るが約3倍速いキャプションモデルを採用、という実測と妥協の記録です。自社でモデルを学習しない中小企業にも転用できる原則を3つ取り出します。
続きを読む →
IBM Researchが公開したScarfBenchは、Enterprise Javaのフレームワーク間移行をAIエージェントに解かせるベンチマークです。最上位のエージェントでも挙動を保った移行の成功率は10%未満、アプリ全体移行30件では29件を成功と自己申告しながら実際にビルドできたのは22件でした。検収基準の置き方を考え直す材料になります。
続きを読む →
Treble TechnologiesがHugging Faceと共同で公開したFFASRリーダーボードは、無響の2,000サンプルを14部屋でシミュレーションし、9条件のうち4条件でASRを比較しました。低SNR(6dB未満)では単語誤り率が近接環境の数倍。ベンダー公表値の読み方と、自社での検証手順を整理します。
続きを読む →
Hugging Faceが自社ツール上でオープンモデルのエージェント能力を3段階の構成で測ったところ、手順書(Skill)を同梱した構成で小型モデルの一致率が67%から43%に落ち、あるタスクでは100%から0%になりました。同じ作業のトークン消費が約2,400から約23,000へ振れた例もあります。中小企業がPoCで何を測るべきかを整理します。
続きを読む →
IBM Researchが、業務AIをLLM単体ではなく従来型ソフト部品で誘導する「エージェントロジック」で組み直したところ、トークン消費が最大30分の1、成功率が1桁台から80%超に改善したと報告しました。数字の条件と、自社製品の提供者による発表という前提を踏まえ、中小企業が投資すべき場所を整理します。
続きを読む →
ServiceNowが公開した音声エージェント評価フレームワークEVAは、航空会社ドメインの英語50シナリオ・15ツール・20システムを対象に、精度(EVA-A)と会話体験(EVA-X)を別々に測りました。全構成でこの2つがトレードオフになったという報告を、中小企業の選定手順にどう落とすかを整理します。
続きを読む →
IBM Research と UC Berkeley が、IT運用タスクを実行したAIエージェントの実行トレース310本を「失敗の型」で分類しました。失敗した実行1回には平均2.6〜5.3個の問題が同時に起きており、成功率という単一の数字が改善の役に立たない理由が数字で示されています。中小企業がPoCの評価条件をどう書くべきかまで整理します。
続きを読む →
OpenEnvのCalendar Gym環境で、AIエージェントのタスク成功率は対象を識別子(ID)で明示した場合に約90%、同じタスクを自然言語で表現した場合に約40%でした。失敗の半数超はツール引数の書式ミスか実行順序の誤りです。発信元はこの評価環境の提供者であり、n数や評価モデル名は開示されていません。
続きを読む →
UAEのTechnology Innovation Instituteが、エミラティ方言を扱う1,173問のベンチマーク「Alyah」で54モデルを評価しました。同じ問題セットで正答率は25.66%から82.18%まで開き、4択の偶然正解25%と区別できないモデルもありました。自社の言葉づかいで測る必要性を示す実例です。
続きを読む →
IBM Researchが公開したAssetOpsBenchは、産業設備の運用業務をAIエージェントに解かせるベンチマークです。最良のGPT-4.1でも計画68.2%・実行72.4%にとどまり、実運用可否の基準である85点に到達したモデルはゼロ。複数エージェントを連携させると47%まで落ちました。中小企業が自動化の範囲を決める材料になります。
続きを読む →
Hugging FaceとEvalEval Coalitionが、22,000超のモデル・2,200のベンチマークにまたがる229,000件の評価結果を1か所に集約しました。そこで露わになったのは、同一モデル・同一ベンチマークでもスコアが63.7と48.8に食い違うという事実です。ベンダー提示の点数をどう扱うべきかを整理します。
続きを読む →