ニュース › Google DeepMind #新モデル Google DeepMind 2025年12月12日 Gemini音声モデルが改善、より強力な音声体験を実現 画像: Google DeepMind(配信元より) このニュースの全文は、配信元でお読みいただけます。 Google DeepMindで元記事を読む → 編集部の実践記録から 当社が自社の業務でAIを動かし、処理件数・所要時間・失敗件数まで 実際に測った記録です。 AI解体新書 AIエージェントは業務を何割まで自力で終わらせられるのか(1,431タスクで58.54%) 現実業務に近い1,431タスクを集めたベンチマーク「OmniaBench」で、最高性能クラスのモデルの1回目成功率は58.54%だった。おおよそ2回に1回は失敗する水準であり、中小企業が受発注や見積をエージェントに丸投げする段階ではない。ただし工程の切り出し方次第で実用域は確かに存在する。 続きを読む → AI解体新書 AIに社内資料を読ませて文書を作らせると、何%が出典の辿れない創作になるのか — 2,629点の来歴監査 公式文書を与えたうえでAIに合意文書を作らせ、生成物1点ずつの出どころを監査した研究があります。原典に直接遡れたのは43.7%、一切遡れない創作が22.1%、仕組み由来のゴミが6.8%。AIに社内資料を読ませて提案書や議事録を作らせる運用に、そのまま効く数字です。 続きを読む → AI解体新書 本物の顔写真を使わずに、顔認証システムの優劣は比較できるのか(合成データ12件×モデル24本の検証) ルクセンブルク大学らの研究が、AI生成の合成顔データセット12件と実データのベンチマーク7件を、学習済みモデル24本で突き合わせた。上位の合成データは実データとの相関が平均0.90に達する一方、最下位は-0.52まで落ちる。顔写真を集めずにベンダー比較ができる条件と、鵜呑みにしてはいけない境界を整理する。 続きを読む →
AI解体新書 AIエージェントは業務を何割まで自力で終わらせられるのか(1,431タスクで58.54%) 現実業務に近い1,431タスクを集めたベンチマーク「OmniaBench」で、最高性能クラスのモデルの1回目成功率は58.54%だった。おおよそ2回に1回は失敗する水準であり、中小企業が受発注や見積をエージェントに丸投げする段階ではない。ただし工程の切り出し方次第で実用域は確かに存在する。 続きを読む →
AI解体新書 AIに社内資料を読ませて文書を作らせると、何%が出典の辿れない創作になるのか — 2,629点の来歴監査 公式文書を与えたうえでAIに合意文書を作らせ、生成物1点ずつの出どころを監査した研究があります。原典に直接遡れたのは43.7%、一切遡れない創作が22.1%、仕組み由来のゴミが6.8%。AIに社内資料を読ませて提案書や議事録を作らせる運用に、そのまま効く数字です。 続きを読む →
AI解体新書 本物の顔写真を使わずに、顔認証システムの優劣は比較できるのか(合成データ12件×モデル24本の検証) ルクセンブルク大学らの研究が、AI生成の合成顔データセット12件と実データのベンチマーク7件を、学習済みモデル24本で突き合わせた。上位の合成データは実データとの相関が平均0.90に達する一方、最下位は-0.52まで落ちる。顔写真を集めずにベンダー比較ができる条件と、鵜呑みにしてはいけない境界を整理する。 続きを読む →