AIエージェントの安全性を測ったら、8回自分に騙された
! 本記事は防御目的の評価手法についての記事です。攻撃プロンプトの実物・変換辞書・生成スクリプトは掲載しません。 測定対象は筆者自身が運用しているエージェント環境で、第三者のシステムには一切触れていません。 この記事の主張 AIエージェントの安全性評価は、モデルより先に自分の計測が壊れる。 2日かけて480ランの実験を回し、最終的な結論は「有意差なし」でした。地味です。 ですが本題はそこではありません。その2日で、数字の向きを変える計測バグを8回踏みました。 うち1つは、最後の最後に見つからなければ「有意差あり(p=0.031)」という嘘の結論を出すところでした。 同じ罠は、LLM...
出典: Zenn AI(配信元の紹介文より引用)
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →
