← AI 動態
The Decoder
OpenAI 開發 AI 自攻自守技術
OpenAI 開發出一款叫做 GPT-Red 的 AI 模型,能夠自動找出其他 AI 模型的安全漏洞,成功率遠高於人類
AI 安全
GPT-Red
OpenAI
OpenAI 的 GPT-Red 模型是通過自我對戰的方式訓練的,能夠模擬出各种攻擊方式,包括提示注入等。這種技術可以幫助 OpenAI 的 AI 模型更加安全。GPT-Red 模型在測試中發現了 84% 的成功攻擊,而人類只有 13%。這項技術對於 AI 的安全性和穩定性有重要影響。OpenAI 將這項技術應用於其 GPT-5.6 模型的訓練中,從而提高模型的安全性和性能