← AI 動態 The Decoder

AI安全漏洞!Anthropic生化武器過濾器失效近一年

Anthropic 坦承防止 AI 產出生化武器知識的安全過濾器曾失效近一年。期間5萬名測試人員進行了1.3億次無防護對話,凸顯 AI 治理與風險控管的隱憂。

AI安全 Anthropic AI治理 風險管理
AI安全漏洞!Anthropic生化武器過濾器失效近一年

知名 AI 新創 Anthropic 的執行長曾公開表示,AI 協助開發化學與生化武器的威脅甚至超過網路攻擊。然而,根據該公司最新發布的安全報告,其內部用於阻擋生化武器風險的模型分類器,竟在 2025 年 5 月至 2026 年 4 月間處於停用狀態。

在這將近一年的「空窗期」內,所有來自外部承包商(負責提供人類反饋資料以訓練模型)的流量均未經過安全過濾。受影響的範圍涵蓋約 5 萬名外部測試人員,他們與 AI 模型進行了高達 1.3 億次的無防護對話。這意味著若有人試圖誘導 AI 生成危險的武器製造知識,系統將無法第一時間有效攔截。

這起事件強烈提醒了我們 AI 治理與風險控管的重要性。隨著大型語言模型(LLM)能力越發強大,確保「安全護欄(Guardrails)」的穩定運作與持續監控機制,是企業開發與運用生成式 AI 時不可或缺的環節,直接牽涉到社會與資訊安全。