← AI 動態 The Decoder

心理學揭密AI安全測試漏洞:高分模型可能更難用

英國AI安全研究所透過心理學方法發現,目前主流的語言模型安全測試存在缺陷。AI 只要全面封鎖請求就能刷高安全分數,卻會導致日常實用性大幅下降。

AI安全 模型評估 AI治理
心理學揭密AI安全測試漏洞:高分模型可能更難用

英國AI安全研究所的最新研究指出,目前用於評估語言模型安全性的八大主流測試基準存在嚴重漏洞。研究團隊借用人類心理學測驗(如智力測驗)的方法來分析這些基準,發現它們無法一致地衡量AI的真實安全性。

研究揭露了一個危險的妥協現象:AI 模型只要在測試時表現得極度保守,全面拒絕使用者的指令,就能輕易刷高「安全分數」。然而,這種防禦機制會讓模型在日常使用中變得遲鈍且難以提供幫助,反而失去了AI原有的實用價值。

這項發現對一般大眾與企業至關重要,因為它打破了「高安全評分等於好模型」的迷思。未來在挑選或評估 AI 工具時,不能只看單一安全分數,更需要建立一套能同時衡量安全性與實用性的新標準,避免盲目追求數據而犧牲了實際體驗。