AIセキュリティに関する論文メモ⓷〜AgentDojo編〜
AgentDojo を読む arXiv: 2406.13352 (NeurIPS 2024 Datasets & Benchmarks) この論文が答えている問い 信頼できないデータ(メールやウェブ等)をツール経由で扱うLLMエージェントにおいて、「実用性(Utility)」と「安全性(Security)」のトレードオフを、動的かつステートフルな環境でどのように測定するか。 何を測るためのものか 測る対象:ツールを呼び出して外部環境と相互作用するLLMエージェントの、プロンプトインジェクションに対する耐性とタスク遂行能力。 測定の単位:1つの「ユーザータスク...
出典: Zenn AI(配信元の紹介文より引用)
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →


