← AI 動態
The Decoder
OpenAI GPT-6 Astra 實測:幻覺大減,但難防隱藏版提示詞攻擊
OpenAI 新模型 GPT-6 Astra 成功減少幻覺並阻擋近乎所有的直接提示詞攻擊。但若惡意指令隱藏於外部文件中,仍有 8.5% 機率被破解,凸顯 AI 面對間接提示詞注入的資安隱憂。
GPT-6
提示詞注入
AI資安
OpenAI 最新推出的 GPT-6 Astra 模型在減少「幻覺」(即 AI 胡說八道)方面取得重大進展,並且能成功攔截高達 99.99% 的「直接提示詞攻擊」。這意味著,如果使用者直接下達違規或惡意指令,這款新一代 AI 已經能非常精準地予以拒絕。
然而,資安危機並未完全解除。測試發現,Astra 仍難以防範所謂的「間接提示詞注入(Indirect Prompt Injections)」。當惡意指令被偷偷隱藏在網頁、PDF 或其他文件內部,並交由 AI 進行讀取與摘要時,Astra 仍有 8.5% 的機率中招,進而執行不該做的指令。相比之下,競爭對手 Claude Opus 5 的失誤率則較低,僅為 4.8%。
對於一般企業與使用者而言,這則新聞提醒我們,在打造讓 AI 讀取外部資料的應用(如 RAG 企業知識庫)時,必須對資料來源的安全保持警覺。即便模型本身的防護力大幅升級,隱藏在龐雜文件中的惡意文字仍可能騙過 AI 成為資安破口。因此,建立多層次的權限控管與內容過濾機制依然不可或缺。