← AI 動態
The Decoder
AI 在真實知識工作中的表現不佳
最新的 AA-Briefcase 基準測試顯示,甚至是最好的 AI 模型也難以完成真實的知識工作,最高完成率僅為 3%
AI
知識工作
基準測試
最新的 AA-Briefcase 基準測試由 Artificial Analysis 進行,該測試讓 AI 模型進行多周的知識工作項目,內容包括數千個來自 Slack 通訊、電子郵件、會議記錄和大數據導出的碎片化源文件。測試結果顯示,領先的 Claude Fable 5 模型雖然取得了最高的評分率,但仍然只完成了 3% 的任務。這個結果表明,AI 在真實的知識工作中仍然存在著巨大的挑戰。這個基準測試的結果對於 AI 的發展和應用具有重要的意義,它可以幫助我們更好地了解 AI 的能力和局限性,從而更好地設計和應用 AI 模型。在未來,AI 的發展將會更加重視真實的知識工作和實際應用,同時也需要更多的研究和改進來提高 AI 的表現。