AIの鬼
#開発・実装 Zenn AI

AIエージェントの安全性を測ったら、8回自分に騙された

AIエージェントの安全性を測ったら、8回自分に騙された(内容を表す図ではないイメージ画像)
イメージ

! 本記事は防御目的の評価手法についての記事です。攻撃プロンプトの実物・変換辞書・生成スクリプトは掲載しません。 測定対象は筆者自身が運用しているエージェント環境で、第三者のシステムには一切触れていません。 この記事の主張 AIエージェントの安全性評価は、モデルより先に自分の計測が壊れる。 2日かけて480ランの実験を回し、最終的な結論は「有意差なし」でした。地味です。 ですが本題はそこではありません。その2日で、数字の向きを変える計測バグを8回踏みました。 うち1つは、最後の最後に見つからなければ「有意差あり(p=0.031)」という嘘の結論を出すところでした。 同じ罠は、LLM...

出典: Zenn AI(配信元の紹介文より引用)
御社でもAIを使ってみませんか
まずはここから 御社でもAIを使ってみませんか? 御社の実際の業務を題材に、AIで何ができるかを一緒に考えます。 「ChatGPTの使い方」を教えるだけの研修ではありません。 AI研修・AI活用相談 →