Google擴充 Gemini 語音模型,瞄準會議紀錄、字幕、客服與語音控制等場景。語音轉文字在多人交談、背景噪音或發言遭打斷時容易失準,新模型則進一步理解上下文與專門術語,並可整理口語內容,降低後續人工校稿成本。
最新推出的 Gemini 3.5 Transcribe 支援超過 85 種語言,Google公布平均字詞錯誤率(WER)為 2.6%。模型可辨識最多三名說話者、自動刪除「嗯、啊」等語助詞,並支援即時翻譯及吵雜環境轉錄;不過目前支援清單未包含繁體中文。
全部報導
5 篇原始報導馬克翻舊帳
這個事件的歷史脈絡Google 發布 Gemini 3.5 Live Translate,實現 70 多種語言即時語音口譯
Google 將 Gemini 3.5 的生成式 AI 能力延伸至即時口譯,核心是直接進行「語音對語音」翻譯,並保留說話者原有語調、節奏與表達方式。相較傳統先轉文字再合成語音的流程,新模型可縮短停頓,對跨國會議、旅遊及客服溝通具有重要性。
Google 最新發布 Gemini 3.5 Live Translate 音訊模型,可即時翻譯超過 70 種語言,並同步導入 Google 翻譯與 Google Meet,同時開放開發者預覽。Google 也已與東南亞叫車及外送平台 Grab 等夥伴展開測試,藉由實際服務場景驗證翻譯速度與自然度。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。