← AI 動態
The Decoder
AI 模型不間斷運行 19 天解 MirrorCode 任務
Epoch AI 的 MirrorCode 測試 AI 模型重建程式的能力,Claude Opus 4.7 領先於 56% 的解題率
AI
MirrorCode
程式開發
Epoch AI 和 METR 推出了 MirrorCode 的新benchmark,要求 AI 模型從頭重建各種電腦科學領域的完整程式,而不需要原始源代碼。Claude Opus 4.7 領先於 56% 的解題率,並在 14 個小時內重建了一個 16,000 行代碼的生物資訊工具套件。雖然所有測試模型都能可靠地處理較小的程式,但目前尚未有一個模型能夠破解最複雜的任務。這項技術對於 AI 的程式開發和學習具有重要意義,可能會對程式開發行業產生重大影響。