その"NEVER"、AIを萎縮させてる? それとも安全にしてる? ── 禁止命令が効くときと壊すとき
1. 「禁止命令を書くな」と「禁止事項は明示せよ」、両方本当らしい AIエージェントへのシステムプロンプトを書いていると、正反対に見える2つの実務知見にぶつかる。 一方には「否定命令はLLMに効きにくい」という指摘がある。"The Pink Elephant Problem"は、Anthropicが自社のシステムプロンプトで否定命令ではなく記述的な文体(Claudeが何をする存在かを描写する)を選んでいることを指摘する。負の指示は「何をしてほしくないか」を理解してから「では何をすべきか」を逆算させるぶん、余計な推論ステップを挟み不安定になる、という説明も添えられている。 もう一方には...
出典: Zenn AI(配信元の紹介文より引用)
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →


