← AI 動態 The Decoder

最新數學基準SOOHAK揭密:AI竟會自信破解「無解之題」

全新數學基準SOOHAK揭露,AI模型雖能解答研究所級數學,卻無法識別「故意出錯的無解題」,甚至會自信滿滿地編造答案,暴露其邏輯盲區。

AI基準測試 數學模型 模型幻覺
最新數學基準SOOHAK揭密:AI竟會自信破解「無解之題」

由64位數學家聯手打造的全新AI數學基準測試「SOOHAK」,包含了439個高等數學任務,其中特別設計了99個存在邏輯矛盾且完全「無解」的題目。測試結果顯示,雖然Google的Gemini 3 Pro在研究所級的複雜難題中表現最佳,但面對這些故意出錯的「無解題」時,所有AI模型的識別正確率皆低於50%,普遍陷入盲目自信的陷阱。

這項發現揭示了當前大型語言模型(LLM)的關鍵缺陷:缺乏真正的邏輯推理與「拒絕回答」的能力。AI在面對荒謬的前提時,依然會一本正經地編造出看似合理的推導步驟。這提醒一般大眾在應用AI進行科學研究或高精度數據決策時,切勿盲目相信其輸出的結果,必須建立嚴格的人類覆核與驗證機制。