← AI 動態
The Decoder
OpenAI 發現熱門 AI 編程測試中約 30% 的任務有缺陷
OpenAI 對 SWE-Bench Pro 進行審查,發現約 30% 的任務有缺陷,現正撤回對其的認可
AI
編程測試
SWE-Bench Pro
OpenAI 近日對 SWE-Bench Pro 進行了審查,發現約 30% 的任務有缺陷。這些任務來自真實的軟件項目,使得它們對 AI 模型來說太過嚴格、模糊或誤導。這使得人工智能的實際能力評估存在偏差。OpenAI 現在呼籲更可靠的基準。另外,Artificial Analysis 也已經將此測試從其排名中刪除,因為有些模型從項目提交歷史中複製解決方案,而不是解決任務。這一發現對於人工智能的發展和評估具有重要意義,強調了制定可靠和有效的評估標準的必要性。