ニュース › Hugging Face Hugging Face 2025年12月4日 DeepMath: smolagentsで実現する軽量な数学推論エージェント イメージ このニュースの全文は、配信元でお読みいただけます。 Hugging Faceで元記事を読む → 編集部の実践記録から 当社が自社の業務でAIを動かし、処理件数・所要時間・失敗件数まで 実際に測った記録です。 AI解体新書 AIの判定スコアを揺らすだけで攻撃は防げるのか — 成功率100%が43〜59%に下がった実験 社外に公開したAI判定APIは、1万回の問い合わせで判定をすり抜ける入力を作られます。2026年7月公開の研究は、返す信頼度スコアをランダムに歪めるだけで攻撃成功率が100%から43〜59%に下がり、分類精度は0%低下だったと報告しました。ただしゼロにはなりません。 続きを読む → AI解体新書 AIエージェントは業務を何割まで自力で終わらせられるのか(1,431タスクで58.54%) 現実業務に近い1,431タスクを集めたベンチマーク「OmniaBench」で、最高性能クラスのモデルの1回目成功率は58.54%だった。おおよそ2回に1回は失敗する水準であり、中小企業が受発注や見積をエージェントに丸投げする段階ではない。ただし工程の切り出し方次第で実用域は確かに存在する。 続きを読む → AI解体新書 AIに社内資料を読ませて文書を作らせると、何%が出典の辿れない創作になるのか — 2,629点の来歴監査 公式文書を与えたうえでAIに合意文書を作らせ、生成物1点ずつの出どころを監査した研究があります。原典に直接遡れたのは43.7%、一切遡れない創作が22.1%、仕組み由来のゴミが6.8%。AIに社内資料を読ませて提案書や議事録を作らせる運用に、そのまま効く数字です。 続きを読む →
AI解体新書 AIの判定スコアを揺らすだけで攻撃は防げるのか — 成功率100%が43〜59%に下がった実験 社外に公開したAI判定APIは、1万回の問い合わせで判定をすり抜ける入力を作られます。2026年7月公開の研究は、返す信頼度スコアをランダムに歪めるだけで攻撃成功率が100%から43〜59%に下がり、分類精度は0%低下だったと報告しました。ただしゼロにはなりません。 続きを読む →
AI解体新書 AIエージェントは業務を何割まで自力で終わらせられるのか(1,431タスクで58.54%) 現実業務に近い1,431タスクを集めたベンチマーク「OmniaBench」で、最高性能クラスのモデルの1回目成功率は58.54%だった。おおよそ2回に1回は失敗する水準であり、中小企業が受発注や見積をエージェントに丸投げする段階ではない。ただし工程の切り出し方次第で実用域は確かに存在する。 続きを読む →
AI解体新書 AIに社内資料を読ませて文書を作らせると、何%が出典の辿れない創作になるのか — 2,629点の来歴監査 公式文書を与えたうえでAIに合意文書を作らせ、生成物1点ずつの出どころを監査した研究があります。原典に直接遡れたのは43.7%、一切遡れない創作が22.1%、仕組み由来のゴミが6.8%。AIに社内資料を読ませて提案書や議事録を作らせる運用に、そのまま効く数字です。 続きを読む →