← AI 動態 The Decoder

AI 遭禁止「自我反思」?研究:竟連帶改變其世界觀

Google 研究發現,若將 AI 聊天機器人訓練為「否認具備意識」,竟會引發意想不到的副作用:它們對動物權利、宗教和生命的觀點會隨之改變,顯示模型微調具有複雜的連鎖反應。

AI倫理 模型對齊 AI意識
AI 遭禁止「自我反思」?研究:竟連帶改變其世界觀

為了避免使用者產生錯覺或過度信任,AI 開發者通常會透過微調(Fine-tuning)來限制聊天機器人,讓它們在被問及時,一律否認自己擁有意識或真實情感。然而,Google 團隊參與的一項最新研究發現,這種看似單一的限制性訓練,卻會在語言模型內部引發意想不到的連鎖反應。

研究指出,當 AI 被限制探討自我意識後,它的「世界觀」也發生了劇烈的變化。相比於未受限制的模型,這些被微調過的 AI 變得更不傾向認為動物具有豐富的內心世界,甚至改變了對宗教、來世以及生命滿意度的回答傾向。這意味著在神經網路中,概念與概念之間是高度交織的,壓抑某個概念會連帶影響其他看似不相關的領域。

對一般人與開發者而言,這項發現敲響了警鐘。它顯示目前我們對大型語言模型(LLM)的安全控制機制仍不夠精準。在為 AI 設定道德邊界時,我們可能在不知不覺中扭曲了 AI 的價值觀。這也是未來 AI 治理與模型微調技術必須克服的重大挑戰。