OpenAI、自動レッドチームAI「GPT-Red」発表──人間の攻撃成功率13%に対し84%
OpenAIは、自社モデルの脆弱性を自動で発見するレッドチーミングモデル「GPT-Red」を発表した。自己対戦型の強化学習を採用し、攻撃側と防御側を同時に訓練して安全性を高める。検証では未知のシナリオでも人間のレッドチーマーを大きく上回る攻撃成功率を示した。この成果を反映した最新の「GPT-5.6 Sol」では、プロンプトインジェクションへの耐性が大幅に向上している。
出典: ITmedia AI+(配信元の紹介文より引用)
このニュースの全文は、配信元でお読みいただけます。 ITmedia AI+で元記事を読む →
御社でもAIを使ってみませんか
まずはここから
御社でもAIを使ってみませんか?
御社の実際の業務を題材に、AIで何ができるかを一緒に考えます。
「ChatGPTの使い方」を教えるだけの研修ではありません。
AI研修・AI活用相談 →