← AI 動態 The Decoder

防AI作弊!Google推雙盲測試確保跑分可信度

AI模型跑分常因訓練時「看過考題」而失真。Google首創以密碼學技術進行雙盲測試,確保AI無法提前偷看考題,讓基準評估結果更加真實可信。

AI評測 基準污染 雙盲測試
防AI作弊!Google推雙盲測試確保跑分可信度

評估 AI 能力時,我們常依賴各種基準測試(Benchmarks)。然而,由於現在的 AI 訓練資料庫極大,模型很可能在訓練時就已看過測試題目。若應試者早知道考題,拿滿分也毫無意義,這在 AI 領域被稱為「基準污染(Benchmark contamination)」問題。

為解決此痛點,Google DeepMind 與新加坡 AI 安全研究所等夥伴合作,對 Gemini 模型展開首次「雙盲評估」試驗。該計畫透過 Confidential Space 密碼學技術,確保 Google 無法提前看到測試考題,同時評估者也無法窺探模型內部的權重,達到真正的雙向保密與考試公平。

這項技術對一般大眾而言也極為重要。隨著 AI 深入我們的日常生活與工作,我們必須確信這些模型的真實能力與安全性,而非僅是「死背考題」的假象。透過客觀且具防弊機制的雙盲測試,未來推出的 AI 產品將更加可靠且值得信賴,這也是落實 AI 治理與負責任 AI 的關鍵一步。