← AI 動態
The Decoder
Google Deepmind研發新模型:視頻生成器中已包含世界模型
Google Deepmind的新模型GenCeption利用預訓練的視頻生成器完成 depth estimation 和 segmentation 等任務
視頻生成器
計算機視覺
深度學習
Google Deepmind的研究人員開發了一個名為GenCeption的模型,它可以將預訓練的視頻生成器應用於傳統的計算機視覺任務,如深度估計和分割。該模型基於阿里巴巴的開源視頻模型,通過單次前向傳播,受文本提示引導,訓練於合成視頻集。GenCeption的表現與現有的專用模型相媲美,並能夠將其能力應用於真實世界的視頻資料。這個模型的開發對於計算機視覺領域具有重要意義,因為它展示了視頻生成器中已經包含了世界模型,这是計算機視覺領域一直缺乏的。這項研究成果對於未來的視頻分析和理解技術具有重要的參考價值。