← AI 動態
The Decoder
GPT-6評測失準惹議!知名平台急更新AI智商指數
知名 AI 評測平台近期大幅更新了指數模型,以回應外界對於 GPT-6 Astra 評分過低、未能反映其實際進步的質疑。更新後 Astra 分數雖有提升,但仍微幅落後對手 Claude。
AI評測
大型語言模型
GPT-6 Astra
知名 AI 評測機構 Artificial Analysis 近期發布了 4.2 版的「AI 智商指數」。這次重大更新主要是為了回應外界的強烈質疑:先前的評分系統未能如實反映最新模型 GPT-6 Astra 的實際進步,甚至給出與前代模型相差無幾的低分。
在此之前,包含 Epoch AI 等多個權威評估機構的數據都顯示,GPT-6 Astra 在各項任務上取得了巨大的飛躍。這種評測標準的巨大差異,凸顯了當前 AI 能力評估的困難度。隨著 AI 變得越來越聰明,傳統的「考試題目」已經難以測出它們的真正實力,導致評測結果可能失真。這也提醒我們,在比較各家 AI 工具時不能只看單一榜單的排名。
經過指標翻新後,GPT-6 Astra 的分數終於獲得修正,比前代高出了 4 分。但值得注意的是,它在該排行榜上依然落後於競爭對手 Anthropic 推出的 Claude Fable 5.1。對一般大眾而言,這意味著頂尖 AI 廠商的競爭依然白熱化,各家在模型能力上互有勝負,而我們將持續受惠於這些越來越強大的 AI 助手。