← AI 動態
The Decoder
阿里發布Qwen3.8:MoE架構挑戰極致性價比
阿里推出 Qwen3.8-Flash-Next 模型,採用混合專家架構。總參數達1250億但單次僅啟動60億,以極低訓練成本超越對手,並透過創新設計降低硬體門檻。
Qwen
MoE架構
大型語言模型
阿里巴巴 Qwen 團隊最新發布的多模態模型 Qwen3.8-Flash-Next,被視為下一代 Qwen4 的架構預覽,且在「極致性價比」上取得重大突破。該模型採用混合專家(MoE)架構,總參數量高達 1250 億,但在生成每個字詞時僅需啟動 60 億個參數。這讓它能以對手九分之一的訓練成本,在程式編寫等任務上擊敗 DeepSeek-V4-Flash 等更大型的模型。
最引人注目的創新是其 N-gram 嵌入層設計。這項技術將常用的詞組當作「片語字典」,且這些高達 510 億參數的資料可直接存放在一般的電腦記憶體(RAM)中,而不必依賴昂貴的顯示卡(GPU)。
對一般大眾與企業而言,這意味著未來部署強大 AI 的硬體門檻將大幅降低。未來企業能用更便宜的設備,發揮出頂級 AI 模型的效能,這將加速生成式 AI 在日常工作與各行各業的普及應用。