← AI 動態 The Decoder

GPT-6評測兩極,ARC測試超越人類推前AGI時程

GPT-6 Astra 在常規測試評價兩極,但在高難度 ARC-AGI-3 測試中效率首度超越人類。專家驚嘆 AI 進展神速,大幅提前通用人工智慧 (AGI) 到來的預估時程。

GPT-6 Astra AGI 通用人工智慧 ARC-AGI 基準測試
GPT-6評測兩極,ARC測試超越人類推前AGI時程

OpenAI 最新推出的 GPT-6 Astra 模型在 AI 圈引發熱烈討論。在傳統基準測試中,各機構給出的評價兩極:Epoch AI 給予極高評價,但 Artificial Analysis 則認為其表現未有明顯突破,甚至落後於部分競品。然而,GPT-6 Astra 在被譽為「最難攻克」的 ARC-AGI-3 測試中,卻為業界投下了震撼彈。

ARC-AGI 測試由知名 AI 學者 François Chollet 設計,專門用來評估 AI 處理未知問題的邏輯推理與適應能力。過去 AI 在這方面的表現一直難以企及人類,但 GPT-6 Astra 卻在該測試中,首次展現了超越人類平均水準的高效率。這意味著 AI 已不再僅是依賴龐大數據庫進行「背誦」或模仿,而是在真正的邏輯推演與舉一反三能力上取得了實質的突破。

這項成就意義非凡。Chollet 驚嘆 AI 的發展速度比他原本預期的「快上兩倍」,並因此大幅提前了對 AGI(通用人工智慧)到來的預測時間。對一般人而言,這代表能真正像人類一樣思考、解決複雜未知難題的超級 AI 助理,將比預期更早走入我們的生活與職場,帶來顛覆性的產業變革。