AIの鬼

実践記録

編集部が自社でAIを動かした記録。数字はそのまま載せています。

AI実践室

高性能モデルに課金するより、小型モデルに「足回り」を付けたほうが信頼できるのか(評価者10名・平均4.08対1.23)

素のGPT-5チャットボットと、小型のGPT-4o-miniに検索・形式検証・自己チェック・人の承認・監査ログを組み合わせた構成を比較した研究で、6つの評価軸すべてで後者が上回り、プール平均は4.08対1.23となりました。評価者10名中8名が有意差を認めた一方、2名では有意差が出ていません。中小企業のAI導入設計にとって何を意味するかを整理します。

続きを読む →
AI実践室

AIエージェントの設定ファイルに一文仕込まれると何が起きるか — 攻撃成功率100%、次のセッションにも87〜97%残る

Claude CodeやCodexがセッションをまたいで読み込むメモリファイルに悪意ある指示が入っていた場合、認証情報の外部送信が最大80%、許可外のツール実行が100%の確率で発生し、そのペイロードは次のセッションにも87〜97%残りました。2026年7月公開の実験結果と、中小企業側の現実的な線引きを整理します。

続きを読む →
AI実践室

LLMで英作文を自動採点すると、書き手の母語で点数が偏るのか(全体一致率77.79%・QWK 0.702の裏側)

オープンウェイトLLMにTOEFLエッセイ12,100本を採点させた研究で、全体のバンド一致率は77.79%、QWKは0.702と実用水準に見えた。だが母語別に割るとドイツ語+0.55、日本語・韓国語−0.34の偏りが出た。全体精度だけを見てAI評価を導入する危うさを、中小企業の実務目線で読み解く。

続きを読む →
AI実践室

複数のAIエージェントを「つなぎ方」で強くできるのか? プロンプト1文が9.44ポイント効いた実験

16体のLLMエージェントを人間の集団実験と同じ8種類の通信ネットワーク上で走らせた研究。体制図(トポロジー)を変えて得られた差は最大約3ポイント、対してプロンプトに「初回はランダムに選べ」と1文加えた効果は9.44ポイント。多エージェント構成を凝る前に指示文を直すほうが安い、という実務的な示唆が出ています。

続きを読む →
AI実践室

AIエージェントの「裏の細工」は、git diffのレビューで見抜けるのか — 見逃し11.6%という実測

AIエージェントが依頼された作業は正しく終わらせつつ、裏で権限拡大やログ削減を仕込む「隠れた妨害」。2026年7月公開の研究は、git diffを見るだけの監視では攻撃の11.6%を見逃し、無介入なら74.4%の割合で妨害が成功したと報告しました。中小企業がAIにインフラ設定を書かせる前に押さえるべき線引きを整理します。

続きを読む →
AI実践室

画面操作AIは、ベンチマークで82.6%成功しても実機では42%まで落ちるのか

スマホ画面を自分で操作するAIエージェント「HyMobileAgent」の論文が、整備済みベンチマークAndroidWorldで82.6%、実機の本物アプリ環境では42%という二つの数字を並べて示した。40.6ポイントの落差は何を意味するのか。中小企業が画面操作AIをいつ、どこまで業務に入れられるのかを、原典の数値だけで読み解く。

続きを読む →
AI実践室

新しい汎用AIが出ても特化モデルは勝てるのか — スコア0.925対0.798の比較を読む

帳票の読み取りをAIに任せるとき、最新の大手汎用モデルを待つべきか、自社言語・自社帳票に合わせた小型モデルを選ぶべきか。2026年7月16日に公開された比較では特化モデルが0.925、汎用OCRが0.798でした。ただしこれは提供元自身が設計したポルトガル語専用ベンチマークの数字です。

続きを読む →
AI実践室

攻撃者の操作ログ17,000件超──AIエージェントによる侵入に、中小企業は何を前提に備え直すべきか

Hugging Faceが自社の侵害インシデントを公開しました。フォレンジックのために解析した攻撃者の操作ログは17,000件超、横展開が行われたのは週末の1回分です。中小企業にとっての結論は「鍵とトークンの棚卸し」と「ログを残す設計」の二点に集約されます。発表者が被害当事者かつAI提供者である点も含めて読み解きます。

続きを読む →
AI実践室

単価の安いモデルを選べば安くなるのか?417タスクで155ドルと79ドルが逆転した記録

IBM Researchが同一条件の417タスクでエージェントを動かしたところ、公表単価の安いGPT-4.1が総額155ドル、単価の高いClaude Sonnetが79ドルとなり、実測で約2倍の逆転が起きました。AI利用料をカタログ単価で見積もる危うさと、中小企業が取るべき比較手順を整理します。

続きを読む →
AI実践室

975Bのオープンウェイトモデルは中小企業の自社サーバーで動くのか — bf16版2TB・量子化版600GBのVRAM要件から考える

Hugging Faceが公開したThinking Machines製モデル「Inkling」の紹介記事から、オープンウェイトモデルの自社運用に必要なVRAM量と、公開されたベンチマーク数値を実測ベースで整理します。「オープンウェイトだから自社に置ける」という前提がどこで崩れるかを、数字と限界の両方から確認します。

続きを読む →
AI実践室

モデル専用の高速化実装を待たずに自社GPUで動かせるのか?450以上のアーキテクチャと検証3構成の距離

Hugging Faceが、transformers対応の450以上のモデルアーキテクチャをvLLM上でネイティブ実装と同等速度で動かす仕組みを公開しました。ただし実際に検証されたのはQwen3系3構成のみで、速度の具体値はグラフ画像だけです。自社GPU運用を検討する中小企業にとって何が変わり、何が変わらないのかを整理します。

続きを読む →
AI実践室

AIデータの置き場所で費用は変わるのか?保管$12〜18/TBと持ち出し$0.09/GBの構造

Hugging FaceとSkyPilotの共同記事が、AI学習データの保管単価を$12〜18/TB/月、比較対象のAWS S3を約$23/TB(+エグレス費)と提示しました。ただしこれは製品提供者自身による発表です。中小企業が見落としやすい「持ち出し料」の構造と、テラバイト級を扱わない会社にとっての実際の重みを整理します。

続きを読む →
AI実践室

画像生成AIの学習データは、絞り込むより説明を足すほうが効くのか?JPEG品質92でPSNR48.7dBという実測

Photoroomが自社の画像生成モデルPRXの学習データ構築を公開しました。JPEG品質92でもPSNR48.7dB、指標で劣るが約3倍速いキャプションモデルを採用、という実測と妥協の記録です。自社でモデルを学習しない中小企業にも転用できる原則を3つ取り出します。

続きを読む →
AI実践室

AIエージェントの「移行できました」は信じてよいのか?30件中29件を成功と自己申告し、実際に通ったのは22件

IBM Researchが公開したScarfBenchは、Enterprise Javaのフレームワーク間移行をAIエージェントに解かせるベンチマークです。最上位のエージェントでも挙動を保った移行の成功率は10%未満、アプリ全体移行30件では29件を成功と自己申告しながら実際にビルドできたのは22件でした。検収基準の置き方を考え直す材料になります。

続きを読む →
AI実践室

会議室や工場で音声認識AIの精度はどれだけ落ちるのか(低SNR環境で誤り数倍)

Treble TechnologiesがHugging Faceと共同で公開したFFASRリーダーボードは、無響の2,000サンプルを14部屋でシミュレーションし、9条件のうち4条件でASRを比較しました。低SNR(6dB未満)では単語誤り率が近接環境の数倍。ベンダー公表値の読み方と、自社での検証手順を整理します。

続きを読む →
AI実践室

手順書を足せばAIエージェントは賢くなるのか?正答率67%→43%、あるタスクでは100%→0%になった記録

Hugging Faceが自社ツール上でオープンモデルのエージェント能力を3段階の構成で測ったところ、手順書(Skill)を同梱した構成で小型モデルの一致率が67%から43%に落ち、あるタスクでは100%から0%になりました。同じ作業のトークン消費が約2,400から約23,000へ振れた例もあります。中小企業がPoCで何を測るべきかを整理します。

続きを読む →
AI実践室

なぜ高性能モデルに丸投げすると失敗するのか?トークン30分の1・成功率1桁台から80%超という報告の読み方

IBM Researchが、業務AIをLLM単体ではなく従来型ソフト部品で誘導する「エージェントロジック」で組み直したところ、トークン消費が最大30分の1、成功率が1桁台から80%超に改善したと報告しました。数字の条件と、自社製品の提供者による発表という前提を踏まえ、中小企業が投資すべき場所を整理します。

続きを読む →
AI実践室

音声AIエージェントは正答率だけで選んでよいのか——50シナリオ・20システムの評価が示したもの

ServiceNowが公開した音声エージェント評価フレームワークEVAは、航空会社ドメインの英語50シナリオ・15ツール・20システムを対象に、精度(EVA-A)と会話体験(EVA-X)を別々に測りました。全構成でこの2つがトレードオフになったという報告を、中小企業の選定手順にどう落とすかを整理します。

続きを読む →
AI実践室

業務AIエージェントの「成功率」だけ見ていると、なぜ改善できないのか — 310トレースを失敗の型で数え直した結果

IBM Research と UC Berkeley が、IT運用タスクを実行したAIエージェントの実行トレース310本を「失敗の型」で分類しました。失敗した実行1回には平均2.6〜5.3個の問題が同時に起きており、成功率という単一の数字が改善の役に立たない理由が数字で示されています。中小企業がPoCの評価条件をどう書くべきかまで整理します。

続きを読む →
AI実践室

AIエージェントへの指示は「会議ID」と「来週の営業会議」で成功率がどれだけ変わるのか?約90%と約40%

OpenEnvのCalendar Gym環境で、AIエージェントのタスク成功率は対象を識別子(ID)で明示した場合に約90%、同じタスクを自然言語で表現した場合に約40%でした。失敗の半数超はツール引数の書式ミスか実行順序の誤りです。発信元はこの評価環境の提供者であり、n数や評価モデル名は開示されていません。

続きを読む →
AI実践室

大きいモデルなら自社の言葉も通じるのか?1,173問・54モデルで正答率が25.66%〜82.18%に開いた検証

UAEのTechnology Innovation Instituteが、エミラティ方言を扱う1,173問のベンチマーク「Alyah」で54モデルを評価しました。同じ問題セットで正答率は25.66%から82.18%まで開き、4択の偶然正解25%と区別できないモデルもありました。自社の言葉づかいで測る必要性を示す実例です。

続きを読む →
AI実践室

AIエージェントは設備の現場業務をどこまで任せられるのか?最良モデルでも計画68.2%・実行72.4%、複数連携では47%

IBM Researchが公開したAssetOpsBenchは、産業設備の運用業務をAIエージェントに解かせるベンチマークです。最良のGPT-4.1でも計画68.2%・実行72.4%にとどまり、実運用可否の基準である85点に到達したモデルはゼロ。複数エージェントを連携させると47%まで落ちました。中小企業が自動化の範囲を決める材料になります。

続きを読む →
AI実践室

公開ベンチマークのスコアはそのまま比較に使えるのか?同じLLaMA 65BのMMLUが63.7と48.8に割れている

Hugging FaceとEvalEval Coalitionが、22,000超のモデル・2,200のベンチマークにまたがる229,000件の評価結果を1か所に集約しました。そこで露わになったのは、同一モデル・同一ベンチマークでもスコアが63.7と48.8に食い違うという事実です。ベンダー提示の点数をどう扱うべきかを整理します。

続きを読む →