即時語音 Agent 過去常須串接語音辨識、大型語言模型與語音合成,延遲與工具等待會破壞對話節奏。Google 的 Gemini 3.8 Live 系列改採原生音訊對音訊架構,鎖定客服、預訂與企業工作流程,代表語音 AI 正從示範走向生產部署。
Google 2026年9月15日推出 Gemini 3.8 Live 與 Extended Thinking,並在 Gemini API 和 AI Studio 上線。後者可邊說邊進行多步推理及工具調用,語音品質指數得82.6分;音訊輸入、輸出每分鐘收費0.005與0.018美元。
全部報導
2 篇原始報導馬克翻舊帳
這個事件的歷史脈絡Google推出Gemini 3.5語音模型,自動過濾贅字與雜音
Google擴充 Gemini 語音模型,瞄準會議紀錄、字幕、客服與語音控制等場景。語音轉文字在多人交談、背景噪音或發言遭打斷時容易失準,新模型則進一步理解上下文與專門術語,並可整理口語內容,降低後續人工校稿成本。
最新推出的 Gemini 3.5 Transcribe 支援超過 85 種語言,Google公布平均字詞錯誤率(WER)為 2.6%。模型可辨識最多三名說話者、自動刪除「嗯、啊」等語助詞,並支援即時翻譯及吵雜環境轉錄;不過目前支援清單未包含繁體中文。
Google發表三款Gemini新模型
生成式 AI 競爭正從聊天機器人轉向可連續呼叫工具、執行多步任務的 AI 代理,企業因而更重視 Token 成本、回應速度與資安能力。Google 以 Gemini Flash 系列補強輕量模型陣容,藉此擴大 Gemini API 生態系並提高大規模部署的經濟性。
截至 2026 年 7 月 29 日,Google 發表 Gemini 3.6 Flash、3.5 Flash-Lite 與 3.5 Flash Cyber 三款模型,主打更快運算與更高 Token 效率。其中 Cyber 微調模型已進入漏洞修補試點;3.5 Pro 仍在測試,下一代 Gemini 4 則已啟動預訓練。
Google 發布 Gemini 3.5 Live Translate,實現 70 多種語言即時語音口譯
Google 將 Gemini 3.5 的生成式 AI 能力延伸至即時口譯,核心是直接進行「語音對語音」翻譯,並保留說話者原有語調、節奏與表達方式。相較傳統先轉文字再合成語音的流程,新模型可縮短停頓,對跨國會議、旅遊及客服溝通具有重要性。
Google 最新發布 Gemini 3.5 Live Translate 音訊模型,可即時翻譯超過 70 種語言,並同步導入 Google 翻譯與 Google Meet,同時開放開發者預覽。Google 也已與東南亞叫車及外送平台 Grab 等夥伴展開測試,藉由實際服務場景驗證翻譯速度與自然度。
Google 推出 Gemini 3.1 Flash TTS 支援 70 種語言與場景導演
Google 持續將 Gemini 多模態能力延伸至語音生成,讓開發者能為客服、影音配音與無障礙服務建立更自然的互動體驗。Gemini 3.1 Flash TTS 支援多語言及情緒控制,降低跨市場製作語音內容的門檻,對 AI 應用在地化尤其重要。
截至 2026 年 7 月 19 日,Google AI 開發者關係負責人 Logan Kilpatrick 宣布 Gemini 3.1 Flash TTS 上線。模型支援 70 種以上語言,開發者可用音訊標籤進行場景導演,調整情緒與表達方式;目前已開放於 Google AI Studio 體驗,並可透過 Gemini API 整合,相關定價尚未公布。
Google 推出 Gemini 3.1 Flash Live 並將 Search Live 推向全球逾 200 個國家
Google自2025年9月先在美國推出Search Live,將生成式AI從文字搜尋延伸至語音與鏡頭連續追問。服務結合Google搜尋索引與AI Mode,可在對話中拆解問題並提供網頁連結,反映Google正以Gemini重塑核心搜尋入口;公司未公布本次部署的投資金額。
2026年3月26日,Google發布即時音訊模型Gemini 3.1 Flash Live,提升多語回應速度、自然度與穩定性,並同步將Search Live擴至AI Mode已上線的200多個國家與地區、支援98種語言。使用者可在Android或iOS版Google App點選Live,也能透過Google Lens以鏡頭搭配語音連續搜尋。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。