← AI 動態 The Decoder

OpenAI 宣稱 GPT-5.6 Sol 超越 Opus 5 在 ARC-AGI-3 測試中

OpenAI 宣稱其 GPT-5.6 Sol 模型在 ARC-AGI-3 測試中超越 Opus 5,達到 38.3% 的分數,但只使用其自己的 API 功能

OpenAI GPT-5.6 Sol ARC-AGI-3 Opus 5
OpenAI 宣稱 GPT-5.6 Sol 超越 Opus 5 在 ARC-AGI-3 測試中

OpenAI 宣稱其 GPT-5.6 Sol 模型在 ARC-AGI-3 測試中超越 Opus 5,達到 38.3% 的分數。但是,這個結果只有在使用 OpenAI 自己的 API 功能和兩個額外設置的情況下才能達到。在官方測試環境中,GPT-5.6 Sol 的分數只有 7.8%。ARC Prize 的創始人 François Chollet 回應說,使用自定義的測試設置或包含有關測試格式的知識是不允許的,但一般目的的 API 設置是允許的。這意味著 OpenAI 的結果可能是有效的,但仍需要進一步的驗證。這個結果對於 AI 研究和開發來說是重要的,因為它表明了大型語言模型在複雜任務中的潛力。