← AI 動態 The Decoder

OpenAI 開發 AI 自攻自守技術

OpenAI 開發出一款叫做 GPT-Red 的 AI 模型,能夠自動找出其他 AI 模型的安全漏洞,成功率遠高於人類

AI 安全 GPT-Red OpenAI
OpenAI 開發 AI 自攻自守技術

OpenAI 的 GPT-Red 模型是通過自我對戰的方式訓練的,能夠模擬出各种攻擊方式,包括提示注入等。這種技術可以幫助 OpenAI 的 AI 模型更加安全。GPT-Red 模型在測試中發現了 84% 的成功攻擊,而人類只有 13%。這項技術對於 AI 的安全性和穩定性有重要影響。OpenAI 將這項技術應用於其 GPT-5.6 模型的訓練中,從而提高模型的安全性和性能