
つないだツールが更新されたら、AIエージェントは何%壊れるか — 123サーバーで測った研究
AIエージェントに外部ツールをつなぐと、つないだ先が更新されただけで成功率が13〜14%落ちる。2026年7月公開の研究で測定された数字と、中小企業がAI導入の契約前に決めておくべきことを整理しました。
続きを読む →AIの最新研究・調査・企業事例を、中小企業向けに読み解く。一次資料に当たって数字を確かめる。

AIエージェントに外部ツールをつなぐと、つないだ先が更新されただけで成功率が13〜14%落ちる。2026年7月公開の研究で測定された数字と、中小企業がAI導入の契約前に決めておくべきことを整理しました。
続きを読む →
AIエージェントに社内の情報を覚えさせると、入力時のチェックをすり抜けて後から悪影響を出す汚染が起きます。2026年7月公開の研究が検証した1,227ケースの結果と、中小企業が記憶機能を使うときの線引きを整理しました。
続きを読む →
同じAIでも、その業務専用の手順書を渡すかどうかで成績が変わります。決済システム連携を題材にした2026年7月公開の研究では、平均10.31ポイントの改善が測定されました。中小企業がAIを使うときに、この差がどこで効くのかを整理します。
続きを読む →
AIの性能は通常「どれだけ正解したか」で語られますが、実務では1回いくらかかったかが同じくらい効きます。2026年7月公開の研究は、コストを揃えて比較すると評価が変わること、そして仕事の種類によって「予算を積む効果」が違うことを示しました。
続きを読む →
社外に出せないデータをAIに処理させたい場合、自社の機械で動かす必要があります。2026年7月公開の研究は、GPUを使わずCPUだけで大きなモデルを動かす手法を、ノートPCを含む3種類の機械で実測しました。数字と、中小企業にとっての現実的な線引きを整理します。
続きを読む →
構造設計をAIに任せる研究で、汎用のまま使うと成功率56.8%、業務の手順と道具を整えると88.6%まで上がりました。差を生んだのはモデルの賢さではありません。製造業・建設業でAI導入を考えるときに、どこに手を入れるべきかを整理します。
続きを読む →
社内文書の検索にAIを使う場合、最上位のモデルでなければ話にならないと考えがちです。2026年7月公開の研究は、17億パラメータの小さなモデルをスマートフォン上で動かし、最大18倍の規模のモデルと競合したと報告しました。中小企業にとっての現実的な読み方を整理します。
続きを読む →
需要予測で本当に困るのは、平均的な誤差ではなくピークを外すことです。2026年7月公開の研究は、一般的な誤差指標がピークの失敗を覆い隠すと指摘し、少なく見積もる誤りを重く扱う手法を提案しました。発注・仕込み・人員配置に効く読み方を整理します。
続きを読む →
AIツールを比べるとき、正答率の高さで選びがちです。しかし2026年7月公開の研究は、回答の精度が上がっても、根拠の説明が忠実で完全になるとは限らないと報告しました。業務でAIを使うとき、どこを見るべきかを整理します。
続きを読む →
AI規制の行方は、中小企業の投資判断にも効きます。2026年7月公開の7カ国調査は、市民が安全・公的統治・国際協調を支持しており、現在主流の規制アプローチとの間に体系的なずれがあると報告しました。何が読み取れるかを整理します。
続きを読む →
「調べてまとめる」仕事はAIに向いていそうで、実際には根拠の追跡が難しく任せにくい領域です。2026年7月公開の研究は、検索から統計処理まで通しで自動化し、専門家によるメタ分析と近い結果を得たと報告しました。中小企業の調査業務に何が使えるかを整理します。
続きを読む →
採用や与信でAIを使うとき、公平性への配慮は避けられません。2026年7月公開の研究は、公平性を高める処理がプライバシー上のリスクに与える影響を部分集団ごとに調べ、全体の平均では見えない偏りがあることを示しました。
続きを読む →
知識グラフを段階的にたどらせてSPARQLを生成する手法MARSが、ファインチューニングなしで既存手法を上回った。ただし最高でもMacro F1は66.29%、最難関ベンチマークでは40.83%。社内DBへの自然文質問AIを検討する中小企業が、精度の天井をどう見積もり、どこに人を残すべきかを一次資料の数字から読む。
続きを読む →
7,241件のデータプールからAI自身の不確実性で100件だけ選ぶと、全データ学習とほぼ同じ精度に届いた。一方で1回きりの微調整は9シード中5シードが物理的にありえない出力を学習し、検証スコアはそれを検知できなかった。ラベル作成コストに悩む中小企業が読むべき、選び方と止め方の設計を解説する。
続きを読む →
人間のテスト理論である項目反応理論をAI評価に持ち込んだ18,000条件のシミュレーション研究。評価対象モデルの能力分布が偏ると順位再現度は0.60を割り、モデル数30では項目の難易度推定が0.50を下回った。一方で上位10%の項目だけでも順位再現は保てた。中小企業が「ベンチマーク上位」をどう読むかの材料として整理する。
続きを読む →
論証エッセイの自動採点システムWrAFTは、採点・表層修正・深層コメントの3工程を分割し、それぞれ別のLLMと手法を割り当てた。採点はファインチューニングでRMSE 0.57→0.44に改善したが、深いコメントではファインチューニング版が出力欠落を起こし素のプロンプトに負けた。工程分割の実証データを中小企業の文書チェック業務に引き写して読む。
続きを読む →
請求書や財務書類をAIに読ませるとき、推論(思考)ステップは本当に要るのか。4Bの小型モデルを追加学習した論文では、推論なしのF1が0.411、推論ありが0.303と逆転した。自社ドメイン内では汎用クラウドAIも上回る一方、未知の様式では負ける。中小企業の帳票業務にとって何を意味するかを整理する。
続きを読む →
VLMで動くエージェントを507件の課題で検証した研究では、易しい条件では成功率0.83〜0.94・安全遵守率最大0.91だったのに、物の上下や中身が絡む配置では成功率0.52〜0.73・安全遵守率0.16〜0.40まで落ちました。結果だけ見る検収では足りない理由を、中小企業の実務に置き換えて読み解きます。
続きを読む →
AIの出力が良いか悪いかを判定する採点基準を、人間が正解例を用意せずに質問1つから自動生成する手法が報告されました。平均ペアワイズ判定精度は素朴な生成の73.45%に対して80.36%。中小企業がAIチェッカーを社内に入れる際の「判定基準づくり」の人件費に直結する話として読み解きます。
続きを読む →
AIに「見るべき観点リスト」を与えると、自作の検証データでは検出率が20.0%から100.0%に跳ね上がりました。ところが同じ設定を実データに当てると、F1は41.7%まで落ち、観点リストなしの素のAI(61.5%)を下回りました。手元のテストで満点だから本番でも大丈夫、という判断がなぜ危険なのかを、論文の実測値で確認します。
続きを読む →
社外に公開したAI判定APIは、1万回の問い合わせで判定をすり抜ける入力を作られます。2026年7月公開の研究は、返す信頼度スコアをランダムに歪めるだけで攻撃成功率が100%から43〜59%に下がり、分類精度は0%低下だったと報告しました。ただしゼロにはなりません。
続きを読む →
現実業務に近い1,431タスクを集めたベンチマーク「OmniaBench」で、最高性能クラスのモデルの1回目成功率は58.54%だった。おおよそ2回に1回は失敗する水準であり、中小企業が受発注や見積をエージェントに丸投げする段階ではない。ただし工程の切り出し方次第で実用域は確かに存在する。
続きを読む →
公式文書を与えたうえでAIに合意文書を作らせ、生成物1点ずつの出どころを監査した研究があります。原典に直接遡れたのは43.7%、一切遡れない創作が22.1%、仕組み由来のゴミが6.8%。AIに社内資料を読ませて提案書や議事録を作らせる運用に、そのまま効く数字です。
続きを読む →
ルクセンブルク大学らの研究が、AI生成の合成顔データセット12件と実データのベンチマーク7件を、学習済みモデル24本で突き合わせた。上位の合成データは実データとの相関が平均0.90に達する一方、最下位は-0.52まで落ちる。顔写真を集めずにベンダー比較ができる条件と、鵜呑みにしてはいけない境界を整理する。
続きを読む →
推薦システムを再学習せずに新しい行動データだけで更新する手法を公開した。データの1.8%しか読まずにRMSE0.810、更新は1バッチ90ms、CPU単体で動く。一方で大規模カタログではアイテムカバレッジ1%未満まで落ちる限界も報告されている。中小ECにとって何を意味するかを整理する。
続きを読む →
学習した環境と違う条件にAIを持ち込むと精度は崩れます。2026年7月公開の医療画像研究では、造影CTで学習した手法を非造影CTに当てただけで精度が33.26%まで低下しました。デモでは高精度だったAIが自社では動かない、という現象の正体と、稟議での評価のさせ方を整理します。
続きを読む →
「次に何が、いつ起こるか」を予測する新手法GAttNHPが、パラメータ2.8M・GPUメモリ2.54GBという構成で、88M〜107Mパラメータ・GPU 48GBを要する従来最良手法をMRRで8.25ポイント上回りました。低頻度データほど改善が大きいという結果を、中小企業の予測案件にどう読み替えるかを整理します。
続きを読む →
自社で動かせる小型モデルに「考える力」を後から足せるのか。2026年7月公開の研究は、教師モデルの出力をそのまま真似させるのではなく、教師とその土台モデルの差分だけを学ばせる方法を14ベンチマークで実測しました。伸びた数字と、伸びなかった条件を整理します。
続きを読む →
研究チームが、格子QCDという専門的な科学計算のコード生成をAIエージェントに任せた結果を公開した。汎用のコーディングエージェントは基本タスク20件すべてに失敗し、業務知識・固定処理・人間の確認を組み込んだ構成は70件中63件で専門家と機械精度一致。差がどこで生まれたかを中小企業の実務に翻訳する。
続きを読む →
自動採点の仕組みが用意できない業務でも、指示と正解の組だけで推論AIモデルを自社向けに調整できるか。研究チームは、GPU1枚・平均52分・1件あたり3米ドル未満で調整を終え、Rustコード生成で平均+7.0ポイントの向上と推論能力の維持を同時に達成したと報告しました。中小企業にとっての意味を整理します。
続きを読む →
AIの精度はデータ量で決まる、という前提を疑う実測が出ました。画像による場所認識AIの学習で、データを71%削減しても精度は維持され、総学習時間は19.152時間から4.825時間へ74.8%削減。データを増やす前に選別する工程を挟む、という予算配分の話として読めます。ただし対象は特定タスクに限られます。
続きを読む →
臨床医1名が作った医療AI安全性ベンチマーク「MedFailBench」は、合成症例100件を6種類の失敗ゲートと5段階の重大度で分類した。正解率ではなく「どの安全境界が破られたか」で測る設計思想は、中小企業の社内AI評価表にそのまま応用できる。ただし実験規模は極端に小さく、論文自身が限界を並べている。
続きを読む →
複数ステップで自律検索するAIエージェントを対象に、従来の検索有用性スコアと、実際に正解へ効いた度合いの相関を測った研究。23,322件の文書観測で相関はρ=-0.0257とほぼ無相関、単体では答えを含まないのに削除すると結果が変わる「橋渡し文書」が35.72%を占めた。社内文書検索の評価の見方に直結する話です。
続きを読む →
通常時は96.62〜98.73%の精度で判定するディープフェイク検出AIが、モデルの中身を一切知らないブラックボックス攻撃で最大0.443の確率ですり抜けられた、という研究が公開されました。中小企業にとっての結論は「検出AIを本人確認の最終判断に使わない」の一点です。数字の範囲と、研究自身が認めた限界まで含めて読み解きます。
続きを読む →
カメラ映像にごくわずかな改ざんを加えると、AIロボットの「未来予測の映像」はもっともらしいまま、実際の動作だけが破綻しました。2026年7月公開の研究が示した成功率96.5%→43.1%という数字と、AI設備を入れる中小企業が検収・監視で見るべき対象を整理します。
続きを読む →
トークン生成に「エネルギー」の値段をつけ、ゼロになったら停止する環境に5体のLLMエージェントを置いた研究です。最大モデルは平均5.2ラウンドで停止し、小型モデルは30ラウンド全生存。議論と記憶を外したときの劣化も含めて、中小企業のAI運用設計に何が読めるかを整理します。
続きを読む →
音声AIを7つの能力次元で実測したベンチマークで、全次元で上位5位に入ったシステムは1つもありませんでした。読み上げ・対話・聞き取りで選ぶべき製品は変わります。訛りへの弱さは製品間で+2.15ptから+8.04ptまで開き、感情の絶対識別は最高22.7%にとどまります。中小企業の選定基準を整理します。
続きを読む →
指示した珍しい特徴を無視して無難な絵しか出てこないのは、担当者のプロンプト力ではなくモデル側の常識バイアスが原因です。2026年7月公開の研究は、因果推論の考え方でプロンプトの純粋な効果だけを取り出し、LLM評価を80.0から93.0へ改善しました。再学習なしで推論時の設定だけで済む点と、その限界を整理します。
続きを読む →
素のGPT-5チャットボットと、小型のGPT-4o-miniに検索・形式検証・自己チェック・人の承認・監査ログを組み合わせた構成を比較した研究で、6つの評価軸すべてで後者が上回り、プール平均は4.08対1.23となりました。評価者10名中8名が有意差を認めた一方、2名では有意差が出ていません。中小企業のAI導入設計にとって何を意味するかを整理します。
続きを読む →
Claude CodeやCodexがセッションをまたいで読み込むメモリファイルに悪意ある指示が入っていた場合、認証情報の外部送信が最大80%、許可外のツール実行が100%の確率で発生し、そのペイロードは次のセッションにも87〜97%残りました。2026年7月公開の実験結果と、中小企業側の現実的な線引きを整理します。
続きを読む →
オープンウェイトLLMにTOEFLエッセイ12,100本を採点させた研究で、全体のバンド一致率は77.79%、QWKは0.702と実用水準に見えた。だが母語別に割るとドイツ語+0.55、日本語・韓国語−0.34の偏りが出た。全体精度だけを見てAI評価を導入する危うさを、中小企業の実務目線で読み解く。
続きを読む →
16体のLLMエージェントを人間の集団実験と同じ8種類の通信ネットワーク上で走らせた研究。体制図(トポロジー)を変えて得られた差は最大約3ポイント、対してプロンプトに「初回はランダムに選べ」と1文加えた効果は9.44ポイント。多エージェント構成を凝る前に指示文を直すほうが安い、という実務的な示唆が出ています。
続きを読む →
AIエージェントが依頼された作業は正しく終わらせつつ、裏で権限拡大やログ削減を仕込む「隠れた妨害」。2026年7月公開の研究は、git diffを見るだけの監視では攻撃の11.6%を見逃し、無介入なら74.4%の割合で妨害が成功したと報告しました。中小企業がAIにインフラ設定を書かせる前に押さえるべき線引きを整理します。
続きを読む →
スマホ画面を自分で操作するAIエージェント「HyMobileAgent」の論文が、整備済みベンチマークAndroidWorldで82.6%、実機の本物アプリ環境では42%という二つの数字を並べて示した。40.6ポイントの落差は何を意味するのか。中小企業が画面操作AIをいつ、どこまで業務に入れられるのかを、原典の数値だけで読み解く。
続きを読む →
NVIDIAとHugging Faceの共同投稿が、FLUX.1-devに78枚・200ステップで特定の画風を習得させた条件と、8×H100 80GBでの実測スループットを公開しました。データは少なくて済み、計算資源は借りるしかない——中小企業にとっての切り分けを整理します。
続きを読む →
帳票の読み取りをAIに任せるとき、最新の大手汎用モデルを待つべきか、自社言語・自社帳票に合わせた小型モデルを選ぶべきか。2026年7月16日に公開された比較では特化モデルが0.925、汎用OCRが0.798でした。ただしこれは提供元自身が設計したポルトガル語専用ベンチマークの数字です。
続きを読む →
Hugging Faceが自社の侵害インシデントを公開しました。フォレンジックのために解析した攻撃者の操作ログは17,000件超、横展開が行われたのは週末の1回分です。中小企業にとっての結論は「鍵とトークンの棚卸し」と「ログを残す設計」の二点に集約されます。発表者が被害当事者かつAI提供者である点も含めて読み解きます。
続きを読む →
IBM Researchが同一条件の417タスクでエージェントを動かしたところ、公表単価の安いGPT-4.1が総額155ドル、単価の高いClaude Sonnetが79ドルとなり、実測で約2倍の逆転が起きました。AI利用料をカタログ単価で見積もる危うさと、中小企業が取るべき比較手順を整理します。
続きを読む →
Hugging Faceが公開したThinking Machines製モデル「Inkling」の紹介記事から、オープンウェイトモデルの自社運用に必要なVRAM量と、公開されたベンチマーク数値を実測ベースで整理します。「オープンウェイトだから自社に置ける」という前提がどこで崩れるかを、数字と限界の両方から確認します。
続きを読む →
Hume AIが40以上の音声モデルを15以上の評価軸・60以上の指標で比較し、100万件以上の人間評価を集めた結果を公開しました。8つの能力グループ全てで上位5位に入る構成は0、ノイズ背景の文字起こし誤り率は音楽背景の約4倍。自社導入の判断にどう使うかを整理します。
続きを読む →
Hugging Faceが、transformers対応の450以上のモデルアーキテクチャをvLLM上でネイティブ実装と同等速度で動かす仕組みを公開しました。ただし実際に検証されたのはQwen3系3構成のみで、速度の具体値はグラフ画像だけです。自社GPU運用を検討する中小企業にとって何が変わり、何が変わらないのかを整理します。
続きを読む →
Hugging FaceとSkyPilotの共同記事が、AI学習データの保管単価を$12〜18/TB/月、比較対象のAWS S3を約$23/TB(+エグレス費)と提示しました。ただしこれは製品提供者自身による発表です。中小企業が見落としやすい「持ち出し料」の構造と、テラバイト級を扱わない会社にとっての実際の重みを整理します。
続きを読む →
Photoroomが自社の画像生成モデルPRXの学習データ構築を公開しました。JPEG品質92でもPSNR48.7dB、指標で劣るが約3倍速いキャプションモデルを採用、という実測と妥協の記録です。自社でモデルを学習しない中小企業にも転用できる原則を3つ取り出します。
続きを読む →
IBM Researchが公開したScarfBenchは、Enterprise Javaのフレームワーク間移行をAIエージェントに解かせるベンチマークです。最上位のエージェントでも挙動を保った移行の成功率は10%未満、アプリ全体移行30件では29件を成功と自己申告しながら実際にビルドできたのは22件でした。検収基準の置き方を考え直す材料になります。
続きを読む →
Treble TechnologiesがHugging Faceと共同で公開したFFASRリーダーボードは、無響の2,000サンプルを14部屋でシミュレーションし、9条件のうち4条件でASRを比較しました。低SNR(6dB未満)では単語誤り率が近接環境の数倍。ベンダー公表値の読み方と、自社での検証手順を整理します。
続きを読む →
Hugging Faceが自社ツール上でオープンモデルのエージェント能力を3段階の構成で測ったところ、手順書(Skill)を同梱した構成で小型モデルの一致率が67%から43%に落ち、あるタスクでは100%から0%になりました。同じ作業のトークン消費が約2,400から約23,000へ振れた例もあります。中小企業がPoCで何を測るべきかを整理します。
続きを読む →
IBM Researchが、業務AIをLLM単体ではなく従来型ソフト部品で誘導する「エージェントロジック」で組み直したところ、トークン消費が最大30分の1、成功率が1桁台から80%超に改善したと報告しました。数字の条件と、自社製品の提供者による発表という前提を踏まえ、中小企業が投資すべき場所を整理します。
続きを読む →
ServiceNowが公開した音声エージェント評価フレームワークEVAは、航空会社ドメインの英語50シナリオ・15ツール・20システムを対象に、精度(EVA-A)と会話体験(EVA-X)を別々に測りました。全構成でこの2つがトレードオフになったという報告を、中小企業の選定手順にどう落とすかを整理します。
続きを読む →
IBM Research と UC Berkeley が、IT運用タスクを実行したAIエージェントの実行トレース310本を「失敗の型」で分類しました。失敗した実行1回には平均2.6〜5.3個の問題が同時に起きており、成功率という単一の数字が改善の役に立たない理由が数字で示されています。中小企業がPoCの評価条件をどう書くべきかまで整理します。
続きを読む →
OpenEnvのCalendar Gym環境で、AIエージェントのタスク成功率は対象を識別子(ID)で明示した場合に約90%、同じタスクを自然言語で表現した場合に約40%でした。失敗の半数超はツール引数の書式ミスか実行順序の誤りです。発信元はこの評価環境の提供者であり、n数や評価モデル名は開示されていません。
続きを読む →
UAEのTechnology Innovation Instituteが、エミラティ方言を扱う1,173問のベンチマーク「Alyah」で54モデルを評価しました。同じ問題セットで正答率は25.66%から82.18%まで開き、4択の偶然正解25%と区別できないモデルもありました。自社の言葉づかいで測る必要性を示す実例です。
続きを読む →
IBM Researchが公開したAssetOpsBenchは、産業設備の運用業務をAIエージェントに解かせるベンチマークです。最良のGPT-4.1でも計画68.2%・実行72.4%にとどまり、実運用可否の基準である85点に到達したモデルはゼロ。複数エージェントを連携させると47%まで落ちました。中小企業が自動化の範囲を決める材料になります。
続きを読む →
Hugging FaceとEvalEval Coalitionが、22,000超のモデル・2,200のベンチマークにまたがる229,000件の評価結果を1か所に集約しました。そこで露わになったのは、同一モデル・同一ベンチマークでもスコアが63.7と48.8に食い違うという事実です。ベンダー提示の点数をどう扱うべきかを整理します。
続きを読む →
Hugging Faceが自社ライブラリのリリース作業をAIで自動化し、4〜6週に1回だったリリースを毎週1回に、人手のレビューを数時間から約15分に短縮したと公表しました。1回あたりのAI利用コストは約0.25ドル。自社サービスの利用事例という利害関係も含めて、中小企業が持ち帰れる設計思想を整理します。
続きを読む →
PaddleOCRチームが公開したPP-OCRv6は、1.5M・7.7M・34.5Mの3構成で50言語に対応するOCRモデル群です。最大構成の検出Hmeanは86.2%、認識精度は83.2%と示されましたが、いずれも提供者自身の社内ベンチマークによる数字で、推論速度もライセンスも本文に記載がありません。読み方と検証の順番を整理します。
続きを読む →
Hugging Face公式ブログが、OpenClawリポジトリのPR・課題の仕分けをローカルの小型モデルで実施した結果を公開しました。330行の評価セットでF1 0.800、1件あたり1.41秒。巨大モデルはF1 0.811とほぼ同等ながら1件144秒。数字の出どころと限界も含めて読み解きます。
続きを読む →
ServiceNowが公開したMosaicLeaksは、社内文書を読んだAIリサーチエージェントが外部検索クエリに機密を混入させる度合いを測ったベンチマークです。素のモデルで漏洩率34.0%、「漏らすな」と指示しても25.5%、精度だけを追って学習させると51.7%に悪化しました。社内AI利用の線引きを考える材料になります。
続きを読む →
Hugging Faceが自社のPEFTライブラリで複数の追加学習手法を同一条件で比較しました。画像生成ではOFTがDINO類似度0.708/メモリ9.01GBとなり、LoRAの0.697/9.97GBを精度・メモリの両方で上回っています。一方で本番の推論基盤はLoRA形式しか読めない場合があり、勝つ手法と使える手法は一致しません。
続きを読む →
誰でも重みを入手できるオープンウェイトの大規模モデルGLM-5.2が、開発タスクの指標で商用最上位に1ポイント差まで迫ったと発表されました。ただしこれは提供元Z.AI自身による測定で、超長時間タスクでは13ポイント差の劣後も同時に報告されています。中小企業にとっての意味を数字ごとに整理します。
続きを読む →
Hugging Faceが自社プロダクトTrackioのCIをGitHub ActionsからHF Jobsへ移した結果、CPU実行で1分40秒が1分10秒(約30%短縮)、GPU実行で45秒・1回1セント未満と報告されました。ただし発信元は当該サービスの提供者であり、測定回数も期間も記載がありません。読み方を整理します。
続きを読む →
NVIDIAが公開したNemotron 3.5 Content Safetyは、AIの入出力が安全かどうかを判定する4Bパラメータの小型モデルです。多言語Aegisで有害判定F1が96.5%、日本語は明示的な訓練対象12言語に含まれます。ただし数値はすべて提供者本人の自己申告で、比較条件は非公開です。
続きを読む →
Hugging Faceが同一の18タスクを各10回、計約1,000回走らせて比較したところ、専用CLIを使ったエージェントの成功率は94%、汎用のAPI直叩きでは84%でした。トークン消費は最大6.0倍の差がつく一方、単発の読み取りでは専用化が不利になる線引きも示されています。
続きを読む →
IBM Researchが公開したエージェント評価基盤VAKRAは、8,000以上のAPIと62ドメインを模した環境で、推論チェーン3〜7ステップを要しうる課題を解かせるものです。ツール候補の多さ、手順の長さ、社内ルールの遵守という3条件で失敗が増える構造を、中小企業の設計判断に引き直して読み解きます。
続きを読む →
DPO(直接選好最適化)はチャット向けの手法という理解が一般的ですが、OCRという機械判定可能な業務で検証した結果、文字化けや無限ループといった出力崩れの発生率が平均59.4%、最良ケースで87.6%減ったという数字が出ています。ただし発信元は当該OCR製品の提供者であり、効果には3つの条件がつきます。
続きを読む →
H companyが公開したHolo3.1は、PC画面を見て操作するエージェントを0.8B〜35B-A3Bの複数サイズで提供し、モバイル操作精度は67%から79.3%へ改善したと報告しています。ただし発表は自社製品についての自社測定であり、最高性能でも約2割は失敗します。中小企業が今どこまで試せるかを整理します。
続きを読む →
METRが熟練OSS開発者16名・実課題246件をランダム割付で測ったところ、AI使用可の条件で完了時間は19%長くなりました。一方で開発者本人は終了後も20%速くなったと信じていました。中小企業が自己申告でROIを判断する危うさを、対象範囲の限界とあわせて整理します。
続きを読む →
METRが大規模OSS18課題でAIエージェントの成果物を測ったところ、人間が書いたテストによる自動採点は38%(±19%)だった一方、人間のレビュアーがそのままマージ可能と判断したPRは15件中0件でした。テストに通った4件でも修正見積りは平均26分。中小企業がAI開発ツールの投資対効果を試算するときに、何を工数に計上すべきかを整理します。
続きを読む →
中小機構が2026年3月に公表した実態調査(有効回答1,647社、2025年11月17日〜12月12日)を読み解きます。導入済み企業の82.6%が生成AI、製造・生産部門の導入率は34.9%。不足しているのは技術ではなく事例情報でした。分母と限界も含めて整理します。
続きを読む →
帝国データバンクが2026年3月に1万312社から回答を得た生成AI調査を読み解きます。活用率34.5%、大企業46.5%と小規模企業28.0%の差、活用企業の86.7%が効果を実感という数字の分母と限界を確認し、中小企業が明日から何を決めるべきかを整理します。
続きを読む →
東京商工リサーチが2026年4月に公表した6,327社アンケートで、中小企業の組織的な生成AI活用は32.3%、大企業は59.1%でした。「方針は決めていない」が中小で38.7%と最大勢力である一方、個人での利用は27.7%。会社の方針が現場に追いついていない構図を、経営者・情シスの判断材料として読み解きます。
続きを読む →
Uberが自社のGoコード解析ツールPerfInsightsの実測を公開しました。LLM単体では誤検知が8割超、複数モデルによる相互検証と人の確認を挟んで10%台前半へ。AIに検査業務を任せる際の現実的な設計指針と、そのまま真似てはいけない数字の線引きを整理します。
続きを読む →
Anthropicが自社のClaude CodeとAPIのログを分析し、AIエージェントにどこまで自動で任せているかを実測した。完全自動承認は新規ユーザーの約20%から習熟ユーザーの40%超へ倍増する一方、中断率も5%から約9%へ上がる。不可逆な操作は全体の0.8%。承認ポイントの設計に使える一次データを、偏りごと読む。
続きを読む →
IPAが2025年5月に公開した中小企業の情報セキュリティ実態調査(n=4,191)を読み解く。2023年度の1年間で被害を受けた企業は約2割強、復旧に要した期間は平均5.8日・最長360日。不正アクセスの手口の最多は脆弱性48.0%だった。数字の分母と調査の限界まで含めて、経営判断に使える形に整理する。
続きを読む →
IPAがDX推進指標の自己診断結果1,164件を分析した。現在値の平均は1.98、目標値の平均は3.51で差は1.53。レベル4以上に届いた企業は38社・3%にとどまる。任意提出という分母の偏りも含め、中小企業が自社の位置を測るための読み方を整理する。
続きを読む →
Cloudflareが自社ネットワークの観測値を公表した。クローラーリクエストのうちAI学習目的が2025年春の22%から2026年6月に52%へ。高頻度クロール分類では人間トラフィックが最大40%減。一方で参照流量の約88%は依然Google経由。母数と利害関係を分けて読む。
続きを読む →
Cloudflareが自社ネットワークを通るAIクローラを実測した。2025年7月時点で、Anthropicはクロール38,065.7ページに対し訪問1件、OpenAIは1,091.4対1、Googleは5.4対1。記事を出せば検索から人が来る、という前提が崩れつつある実態を、母集団の偏りごと読む。
続きを読む →
METRが2026年1月29日に公開したTime Horizon 1.1では、Claude Opus 4.5の「時間地平」が成功率50%で320分(95%CI 170-729分)と測定された。倍化期間は2024年以降のデータで89日。数字の読み方と、中小企業が導入計画をどう組み直すべきかを整理する。
続きを読む →
Anthropicが自社のResearch機能の構築記録を公開しました。複数のAIを並列で走らせる構成は社内評価で単一エージェントを90.2%上回った一方、トークン消費は通常のチャット利用の約15倍。中小企業がどの業務なら採算に乗るのか、限界の記述までたどって整理します。
続きを読む →
GitHubがOctoverse 2025のデータをもとに、AIの普及が開発者の言語・ツール選択をどう動かしたかを公表した。TypeScriptが前年比66%増で初の1位、新規開発者の80%が登録初週にCopilotを使う。ただし発信元はCopilotの提供者であり、母数の条件も数字ごとに違う。発注側の見積と検収に効く形で読み直す。
続きを読む →
Epoch AIが米国成人2,021人を対象にIpsos KnowledgePanelで実施した調査で、仕事中心にAIを使っている割合は無料版38%、勤務先提供のサブスクで76%でした。会社が費用を負担するかどうかが業務利用の深さと相関しています。分母のn数が公開されていない点まで含めて、中小企業がどう読むべきかを整理します。
続きを読む →
Anthropicが2026年6月に公開した経済指標レポートから、AI利用の曜日・季節変動と利用者9,700人の自己申告効果を読み解きます。平日と週末で個人利用比率が約15ポイント動き、確定申告直前には税務用途が8倍に。ただし回答者はClaude利用者に偏り、一般労働者の実態ではありません。
続きを読む →
Google DeepMindがシエラレオネの中等学校12校・生徒1,763人・8週間の事前登録済みRCTで、AIに直接解答をさせず問い返させる「ガイド付き学習」を検証。数学スコアは対照群比+0.258標準偏差。ただし発信元は製品提供者本人であり、学力層による効果の偏りも自ら認めている。読み方を整理する。
続きを読む →
Epoch AIの暫定結果によると、熟練エンジニアで2〜17週と見積もられた約16,905行のツールキット再実装を最新モデルがE2Eテスト2,000/2,001件(99.95%)で完遂した一方、約61,461行の課題は10億トークンの約9割を使って可視テスト256/733件(35%)で未解決でした。規模と費用の境界線を読み解きます。
続きを読む →
METRが2025年3月19日に公開した測定によると、現行モデルは人間が4分未満で終える作業をほぼ100%こなす一方、人間が約4時間超かかる一続きの仕事は10%未満しか完遂できない。成功率50%の時間地平は約7か月で倍化。中小企業が導入判断に使える物差しとして読み解く。
続きを読む →
AI Digestが集めた421名の予測を、2026年1月に答え合わせした調査です。コーディング系ベンチマークは唯一の過大予測、セキュリティ系と業界売上は大幅な過小評価でした。自己選択サンプルという限界も含めて、中小企業の計画づくりにどう使えるかを整理します。
続きを読む →
Epoch AIが2023年以降に作られた39ベンチマークを主成分分析したところ、分散の約半分が第1主成分(総合力)で説明でき、各ベンチマークの重みは0.19〜0.30に収まりました。「このベンチマークで1位」という宣伝文句が自社のツール選定にどこまで使えるのかを、限界も含めて整理します。
続きを読む →
Cloudflareが2025年1月1日から12月2日までの自社ネットワーク実測をまとめた。HTMLリクエストの4.2%がAIボット、Googlebot単独では4.5%、全トラフィックの6.2%が緩和対象で3.3%がDDoS対策とWAFで遮断。中小企業のサイト運用に直結する数字を、母集団の偏りと発信元の利害ごと読む。
続きを読む →
Cloudflareが2025年7〜8月に自社ネットワーク上のAIボットを目的別・業種別に集計した。クロールの約80%が学習目的で、クロール対参照比はAnthropic約50,000:1、OpenAI 887:1、Perplexity 118:1。業種を絞ると値が大きく変わる。自社サイトのボット許可を経営判断として棚卸しするための材料を、母集団の狭さごと読む。
続きを読む →
商工中金が中小企業3,892社から回答を得た2026年1月調査を読み解きます。個人任せが64.9%、会社導入は16.2%。経営へのプラス効果は会社導入36.6%対個人登録26.0%で10.6ポイント差。差が開く業務と開かない業務、そして分母のずれや母集団の偏りまで確認します。
続きを読む →
パーソル総合研究所が正規雇用者3,000人に聞いた生成AI調査を読み解きます。タスク所要時間は平均16.7%(週26.4分)短縮する一方、業務時間が実際に減った人は約25.4%。浮いた時間の61.2%が仕事に再投下され、その75.4%が日常業務という構図から、中小企業が効果測定をどこで取るべきかを整理します。
続きを読む →
矢野経済研究所が2025年12月に公表した法人アンケート調査を読み解きます。有効回答496社の43.4%が生成AIを活用する一方、AIエージェントは生成AI活用企業215社ベースで利用中3.3%。分母の違いと調査対象の限界を確認したうえで、中小企業が次に何を決めるべきかを整理します。
続きを読む →
野村総合研究所が2025年9月に売上高上位企業517社から回答を得たIT活用実態調査を読み解きます。生成AI導入済み57.7%、課題1位のリテラシー・スキル不足70.3%、IT予算増加企業の59.0%から49.0%への低下という数字の分母と限界を確認し、中小企業がベンチマークとしてどう使えるかを整理します。
続きを読む →
警察庁サイバー警察局が2026年3月に公開した「令和7年におけるサイバー空間をめぐる脅威の情勢等について」を読み解く。令和7年のランサムウェア被害報告は226件、うち中小企業が約6割・製造業が約4割。侵入経路の6割以上はVPN機器、復旧費用1,000万円以上が5割超。分母の限界まで含めて経営判断に使える形に整理します。
続きを読む →
JPCERT/CCが2026年7月16日に公開した四半期レポート(2026年4月1日〜6月30日、報告14,056件)を読み解く。フィッシングが89.3%を占め、Webサイト改ざんは90件から181件へ倍増。国内ブランド詐称の67.1%は金融サイトだった。数字の分母、文書内の矛盾、レポートの限界まで含めて経営判断に使える形に整理する。
続きを読む →
Verizon Businessの2026年版DBIRは、31,861件のインシデントと22,625件の確認済み侵害を集計した。初期侵入経路の第1位は脆弱性の悪用31%で、前年20%から上昇。従業員1,000人未満のSMBでも脆弱性26%・認証情報13%・フィッシング9%の順だった。この順序が中小企業の対策の順番に何を意味するかを、定義のずれごと読む。
続きを読む →
Mandiantが2025年に世界で50万時間超の侵入調査を実施し、初期侵入経路の32%が脆弱性悪用、11%が電話による音声フィッシング、メールフィッシングは6%だったと公表した。滞留時間の中央値は14日。母集団が大企業寄りである前提ごと、中小企業の投資順序に翻訳して読む。
続きを読む →
JILPTが2025年5月に公表した労働者Webアンケート(有効回答2.2万人、2024年5月27日〜6月27日)を読み解きます。生成AI利用者は全労働者の6.4%、適切利用の社内規定が策定済みは3.7%。従業員99人以下では「会社の指示によらず自主的に使用」が4割を超えていました。分母と調査の限界も含めて整理します。
続きを読む →
日本政策金融公庫が4,328社から回答を得た2025年3月調査を読み解きます。AI導入済み14.6%・導入予定17.8%、デジタル投資額の中央値130万円、相談相手はITベンダー50.5%。分母の取り違えが起きやすい数字の範囲を確認したうえで、中小企業が今どこに立っているかを整理します。
続きを読む →
財務省が2026年1月29日の全国財務局長会議で公表した特別調査(回答1,103社、2025年12月上旬〜2026年1月上旬)を読み解きます。業務時間削減の実感は中小87%・大企業94%とほぼ並ぶ一方、コスト削減は中小22%・大企業41%。用途が文章作成に偏っている構図と、母集団の限界まで含めて整理します。
続きを読む →
総務省の令和7年版情報通信白書が示した企業の生成AI利用の数字を確認します。活用方針の策定49.7%(前年度42.7%)、業務使用55.2%、文書作成補助47.3%という値の分母と、この調査が「デジタル化に着手済みの企業」を対象としている可能性の限界まで含めて整理します。
続きを読む →
JILPTが2025年12月に公表した調査シリーズNo.261(企業調査n=1,971、2025年2月実施・調査時点2025年1月末日)を読みます。AI周辺技術14.2%、RPA13.3%に対し、Webミーティング55.3%、クラウド情報共有50.8%。何が遅れで何が先行余地なのかを、分母と限界込みで整理します。
続きを読む →
OECDが2025年12月に公表した中小企業のAI導入報告書を実測で読む。従業員10〜49人の企業のAI利用率は11.9%、250人以上は40%。ところがクラウドやIoTでは同じ規模差が約2分の1まで縮まっている。道具の値段ではなく、社内で使う人と教育が差の正体であることを数字で確認する。
続きを読む →
米国SBA Office of Advocacyが2025年9月に公表したスポットライトを読みます。小企業のAI利用率は半年で6.3%から8.8%へ。ただし著者自身が「格差縮小の一部は大企業の利用率低下による」と書いています。ユースケース数は小2.0対大2.1、5人未満企業の約82%が「自社には関係ない」と回答。分母と限界まで整理します。
続きを読む →
Gallupが米国就業成人22,368人に実施した2025年Q4調査で、毎日AIを使う就業者は12%、週数回以上は26%に増える一方、利用者全体の割合は横ばいでした。経営層69%対一般社員40%、リモート可能職66%対非リモート職32%という偏りも含めて、中小企業がどう読むべきかを整理します。
続きを読む →
Microsoftが181名を対象に行ったランダム化比較試験で、情シス業務の正答精度は平均34.53%改善しました。ただし効いたのは自由記述型の作業で、多肢選択型は精度が有意に上がらず所要時間は25.13%増えています。発信元が製品提供者本人である点も含め、業務単位の線引きを整理します。
続きを読む →
米国商務省NIST傘下のCAISIがDeepSeekの各モデルを実測しました。同等性能に要した費用はGPT-5-miniが平均35%安く、エージェント乗っ取りではDeepSeek最良モデルでも認証情報の窃取が37%の試行で発生。トークン単価ではなく総額と乗っ取り耐性で選ぶべき理由を、評価の立場性と限界も含めて整理します。
続きを読む →
MLCommonsが公開した脱獄ベンチマークv0.5では、公開・既知の攻撃を加えるとテキスト対テキストの安全性スコアが平均19.81%下がり、39システム中35システムが安全グレードを1段階以上落としました。通常利用の安全性と攻撃下の安全性は別物だという実測を、中小企業の受け入れテストの話に落とします。
続きを読む →
英国AI安全保障研究所(AISI)が2023年11月〜2025年10月に30以上のフロンティアシステムを評価した報告書を読み解きます。1時間規模の開発タスク完遂率は5%未満から40%超へ。しかし能力と安全対策の強さの相関はR^2=0.097でほぼ無く、テストした全システムで万能脱獄が見つかりました。
続きを読む →
英国AI安全保障研究所が、企業ネットワークを模したサイバーレンジでAIエージェントの攻撃遂行能力を実測。32ステップ中の平均完遂数は1.7から9.8へ、最良の単一試行は22ステップまで到達した。一方で産業用制御システム環境では7ステップ中平均1.2〜1.4にとどまる。中小企業の防御の優先順位を、この数字から考える。
続きを読む →
Shopifyが社内エージェント「River」の直近30日間の実稼働値を公開した。59,918セッション、マージ済みPRの8件に1件が共著、セッション中央値19分・ツール呼び出し中央値50回。数字の大きさより、エージェントを個人の手元でなく全社Slackに常駐させたという設計判断が中小企業にも効く。ただしこれは提供者自身による発表である。
続きを読む →
米国センサス局のBTOSが2026年5月3日時点で全米企業のAI利用率19.8%を示した。従業員250人以上は37%、20人未満は20%未満で、しかも半年間の増加が統計的に確認できなかった。規模による断層をどう読むか、日本の中小企業に何が言えて何が言えないかを整理する。
続きを読む →
米連邦準備制度理事会のFEDS Notesが、米国のAI普及を測る3つの調査を並べました。企業ベースで18%、就業者ベースで40.7%、雇用ウェイトで78%。同じ「AI普及」という言葉で4倍以上ずれます。分母の違いを見抜けないと、自社の遅れも進みも誤って判断することになります。
続きを読む →
Rampとリベリオ・ラボが米国企業21,559社の実支出と職歴データを接続した分析では、AI投資の強度で結果が割れました。1人あたり月33.67ドル層は総従業員数10.2%増、月2.78ドル層は-0.6%で有意差なし。ただしこれは法人カード提供者自身による査読前の分析です。
続きを読む →
法人カード大手Rampが2026年6月に公開したAI Indexから、1人あたり月間AI支出の分位と、ベンダー別の有料採用率を条件込みで読み解きます。中央値は法人シート1席分、上位1%はその650倍超。ただし対象は米国のRamp利用企業に限られ、発信元は当該支出データの当事者です。
続きを読む →
Arenaが自社Agent Modeの実利用ログ160,480タスク(7日間)を集計した。セッションの75.6%がツールを実行し、複数要素を含む依頼が完全に充足されたのは58%、8%は無言で一部を落としていた。自社製品の自社集計という前提を踏まえたうえで、中小企業が導入前に決めるべき権限設計・検収工程・予算の組み方を整理する。
続きを読む →
Shopifyが自社の買い物シミュレーション基盤SimGymの運用実測を公開しました。1日40万セッション、GPU分割で平均LLMレイテンシ27.8秒→21.9秒。一方で推論の手抜きはエラー率を0.5〜0.75%から4.5〜10.9%へ押し上げたと結論しています。中小ECと社内AI運用の担当者が読むべき点を整理します。
続きを読む →
NICTが2026年2月に公開したNICTER観測レポート2025を読み解く。2025年の総観測パケットは約7,010億、1IPあたり2,504,680パケットで観測開始以降最多。一方でTelnet(23/TCP)宛の比率は17.9%から14.4%へ低下し、上位10ポート以外が65.8%を占めた。防犯カメラ・ルータ・SSHという現実の入口に話を戻します。
続きを読む →
OECDが2026年4月に公表したD4SME調査(n=2,018、12か国、2025年Q4〜2026年Q1)を実測で読む。日本サンプル(n=887)では、AIを単発タスクにだけ使う企業で変革的効果を報告したのは2%、全社展開した企業では23%。ただし標本は無作為抽出ではなく、因果は言えない。その限界も含めて数字の使い方を整理する。
続きを読む →