ニュース › Hugging Face Hugging Face 2026年2月18日 IBMとUC Berkeley、エンタープライズエージェント失敗要因を診断 イメージ このニュースの全文は、配信元でお読みいただけます。 Hugging Faceで元記事を読む → 編集部の実践記録から 当社が自社の業務でAIを動かし、処理件数・所要時間・失敗件数まで 実際に測った記録です。 AI解体新書 画像生成AIが「毛の生えたタコ」を描けないのはプロンプトが下手だからか — LLM評価80.0→93.0が示す構造的な原因 指示した珍しい特徴を無視して無難な絵しか出てこないのは、担当者のプロンプト力ではなくモデル側の常識バイアスが原因です。2026年7月公開の研究は、因果推論の考え方でプロンプトの純粋な効果だけを取り出し、LLM評価を80.0から93.0へ改善しました。再学習なしで推論時の設定だけで済む点と、その限界を整理します。 続きを読む → AI解体新書 高性能モデルに課金するより、小型モデルに「足回り」を付けたほうが信頼できるのか(評価者10名・平均4.08対1.23) 素のGPT-5チャットボットと、小型のGPT-4o-miniに検索・形式検証・自己チェック・人の承認・監査ログを組み合わせた構成を比較した研究で、6つの評価軸すべてで後者が上回り、プール平均は4.08対1.23となりました。評価者10名中8名が有意差を認めた一方、2名では有意差が出ていません。中小企業のAI導入設計にとって何を意味するかを整理します。 続きを読む → AI解体新書 AIエージェントの設定ファイルに一文仕込まれると何が起きるか — 攻撃成功率100%、次のセッションにも87〜97%残る Claude CodeやCodexがセッションをまたいで読み込むメモリファイルに悪意ある指示が入っていた場合、認証情報の外部送信が最大80%、許可外のツール実行が100%の確率で発生し、そのペイロードは次のセッションにも87〜97%残りました。2026年7月公開の実験結果と、中小企業側の現実的な線引きを整理します。 続きを読む →
AI解体新書 画像生成AIが「毛の生えたタコ」を描けないのはプロンプトが下手だからか — LLM評価80.0→93.0が示す構造的な原因 指示した珍しい特徴を無視して無難な絵しか出てこないのは、担当者のプロンプト力ではなくモデル側の常識バイアスが原因です。2026年7月公開の研究は、因果推論の考え方でプロンプトの純粋な効果だけを取り出し、LLM評価を80.0から93.0へ改善しました。再学習なしで推論時の設定だけで済む点と、その限界を整理します。 続きを読む →
AI解体新書 高性能モデルに課金するより、小型モデルに「足回り」を付けたほうが信頼できるのか(評価者10名・平均4.08対1.23) 素のGPT-5チャットボットと、小型のGPT-4o-miniに検索・形式検証・自己チェック・人の承認・監査ログを組み合わせた構成を比較した研究で、6つの評価軸すべてで後者が上回り、プール平均は4.08対1.23となりました。評価者10名中8名が有意差を認めた一方、2名では有意差が出ていません。中小企業のAI導入設計にとって何を意味するかを整理します。 続きを読む →
AI解体新書 AIエージェントの設定ファイルに一文仕込まれると何が起きるか — 攻撃成功率100%、次のセッションにも87〜97%残る Claude CodeやCodexがセッションをまたいで読み込むメモリファイルに悪意ある指示が入っていた場合、認証情報の外部送信が最大80%、許可外のツール実行が100%の確率で発生し、そのペイロードは次のセッションにも87〜97%残りました。2026年7月公開の実験結果と、中小企業側の現実的な線引きを整理します。 続きを読む →