← AI 動態 The Decoder

英國人工智慧安全研究所發現標準基準低估AI代理的實際能力

研究顯示當計算預算增加時,AI模型的成功率可提高25%,尤其在網絡安全和軟體開發任務中

人工智慧 AI安全 基準評估

英國人工智慧安全研究所的一項研究發現,常見的基準低估了人工智慧代理的能力,尤其是在計算預算有限的情況下。這意味著當前的人工智慧評估可能沒有反映出這些系統的全部潛力。當AI模型被給予更多的計算時間和資源時,它們的成功率可以提高到25%。這項研究的發現對於網絡安全和軟體開發等領域尤其重要,因為它們需要人工智慧代理具有更強的能力和更高的成功率。這項研究的結果對於人工智慧的發展和應用具有重要的影響,它意味著我們需要重新評估人工智慧代理的能力和潛力。