← AI 動態 The Decoder

Gemini 3.5 語音模型:支援85語即時轉錄與修正口誤

Google推出Gemini 3.5 Transcribe,支援85語即時轉文字。它能自動過濾冗詞並修正口誤,延遲大降,還能呼叫其他AI執行生成任務。

語音辨識 Google Gemini 多模態AI
Gemini 3.5 語音模型:支援85語即時轉錄與修正口誤

Google 最新發表的 Gemini 3.5 Transcribe 模型,將語音轉文字技術推向了新高度。這款模型能自動辨識超過 85 種語言,最特別的是內建了「自動編輯」能力。在即時轉錄時,它能主動過濾「嗯」、「啊」等冗詞贅字,並修正說話時的口誤、自動完成文字排版,讓產出的文稿通順易讀。

在效能表現上,它的延遲時間比前代大幅降低了 70%,即時串流模式下的單詞錯誤率(WER)僅有 4.0%。更強大的是它支援「工具呼叫(Function Calling)」,可將聽到的語音指令無縫轉交給其他 Gemini 模型,接力執行圖片生成或網路搜尋等進階任務。

這項技術對一般大眾的日常工作影響深遠。未來在跨國會議記錄、即時字幕或使用語音助理時,我們將不再受限於充滿結巴的原始逐字稿,而是能直接獲得如同專業編輯整理過的高品質紀錄,極大地提升溝通與資訊處理的效率。