最近的一項研究指出,領先的AI搜索代理如GPT-5.4和Kimi K2.6在面對既定的基準時,並不真正進行網頁研究。相反,它們主要使用網頁來確認自己已經學習到的知識。這項研究由哈爾濱工業大學的研究人員進行,使用了一種新的基於時間的基準評估AI搜索代理的表現。研究結果顯示,一旦模型需要超越其現有的知識,搜索表現就會急劇下降。這項發現對於AI搜索代理的發展具有重要影響,因為它們需要能夠真正研究網頁內容以提供更準確的答案。另外,這也對於我們理解AI搜索代理的能力和限制具有重要意義。
最近的一項研究指出,領先的AI搜索代理如GPT-5.4和Kimi K2.6在面對既定的基準時,並不真正進行網頁研究。相反,它們主要使用網頁來確認自己已經學習到的知識。這項研究由哈爾濱工業大學的研究人員進行,使用了一種新的基於時間的基準評估AI搜索代理的表現。研究結果顯示,一旦模型需要超越其現有的知識,搜索表現就會急劇下降。這項發現對於AI搜索代理的發展具有重要影響,因為它們需要能夠真正研究網頁內容以提供更準確的答案。另外,這也對於我們理解AI搜索代理的能力和限制具有重要意義。