← AI 動態 The Decoder

AI 其實看不懂圖?新測試揭露頂尖模型的視覺缺陷

新基準測試 PerceptionBench 發現,包含 GPT-5.6 在內的頂尖 AI,視覺感知準確率竟不到六成。這證實 AI 許多邏輯錯誤,其實是因一開始就「看錯」圖片,凸顯多模態模型的缺陷。

多模態模型 視覺感知 AI能力邊界
AI 其實看不懂圖?新測試揭露頂尖模型的視覺缺陷

近期,Moonshot AI 推出了名為 PerceptionBench 的新基準測試,專門評估多模態 AI 模型「看」圖片的能力。過去我們常以為 AI 答錯圖片問題是因為邏輯推理不足,但這項測試將「視覺感知」與「邏輯推理」獨立分開。結果顯示,即便是包含 GPT-5.6 Sol、Kimi K3 和 Claude Fable 5 在內的最先進模型,在基礎視覺測驗中準確率皆未達 60%,表現差強人意。

這項發現極具意義,因為它點出了一個關鍵盲點:許多看似 AI 推理錯誤的情況,其實是因為它打從一開始就「看錯」了圖片細節。這就像視力不佳的學生,就算邏輯再好,看錯題目也無法給出正確答案。研究證實,即便 AI 語言能力突飛猛進,在真實世界的視覺感知上仍有巨大落差。

對一般大眾與企業而言,這代表在依賴 AI 處理圖像任務(如醫療影像輔助、文件圖表分析)時必須保持警惕,不能盲目相信 AI 的「眼力」,人類的覆核仍不可或缺。未來,這也將促使 AI 開發商重新聚焦於強化模型的底層視覺感知技術。