Google 推出 Gemini 3.1 Flash TTS 支援 70 種語言與場景導演
Google 持續將 Gemini 多模態能力延伸至語音生成,讓開發者能為客服、影音配音與無障礙服務建立更自然的互動體驗。Gemini 3.1 Flash TTS 支援多語言及情緒控制,降低跨市場製作語音內容的門檻,對 AI 應用在地化尤其重要。
截至 2026 年 7 月 19 日,Google AI 開發者關係負責人 Logan Kilpatrick 宣布 Gemini 3.1 Flash TTS 上線。模型支援 70 種以上語言,開發者可用音訊標籤進行場景導演,調整情緒與表達方式;目前已開放於 Google AI Studio 體驗,並可透過 Gemini API 整合,相關定價尚未公布。
全部報導
2 篇原始報導馬克翻舊帳
這個事件的歷史脈絡Google 發布 Gemini 3.5 Live Translate,實現 70 多種語言即時語音口譯
Google 將 Gemini 3.5 的生成式 AI 能力延伸至即時口譯,核心是直接進行「語音對語音」翻譯,並保留說話者原有語調、節奏與表達方式。相較傳統先轉文字再合成語音的流程,新模型可縮短停頓,對跨國會議、旅遊及客服溝通具有重要性。
Google 最新發布 Gemini 3.5 Live Translate 音訊模型,可即時翻譯超過 70 種語言,並同步導入 Google 翻譯與 Google Meet,同時開放開發者預覽。Google 也已與東南亞叫車及外送平台 Grab 等夥伴展開測試,藉由實際服務場景驗證翻譯速度與自然度。
Google 推出 Gemini 3.1 Flash Live 並將 Search Live 推向全球逾 200 個國家
Google自2025年9月先在美國推出Search Live,將生成式AI從文字搜尋延伸至語音與鏡頭連續追問。服務結合Google搜尋索引與AI Mode,可在對話中拆解問題並提供網頁連結,反映Google正以Gemini重塑核心搜尋入口;公司未公布本次部署的投資金額。
2026年3月26日,Google發布即時音訊模型Gemini 3.1 Flash Live,提升多語回應速度、自然度與穩定性,並同步將Search Live擴至AI Mode已上線的200多個國家與地區、支援98種語言。使用者可在Android或iOS版Google App點選Live,也能透過Google Lens以鏡頭搭配語音連續搜尋。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。