馬克雷達MARK RADAR
關於
EN
登入
事件檔案 AI Agentic AI Google

Google推出Gemini 3.8 Live系列原生語音模型

2 篇報導 · 首次偵測 2026-09-16 · 最後活動 2026-09-16

即時語音 Agent 過去常須串接語音辨識、大型語言模型與語音合成,延遲與工具等待會破壞對話節奏。Google 的 Gemini 3.8 Live 系列改採原生音訊對音訊架構,鎖定客服、預訂與企業工作流程,代表語音 AI 正從示範走向生產部署。

Google 2026年9月15日推出 Gemini 3.8 Live 與 Extended Thinking,並在 Gemini API 和 AI Studio 上線。後者可邊說邊進行多步推理及工具調用,語音品質指數得82.6分;音訊輸入、輸出每分鐘收費0.005與0.018美元。

全部報導

2 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡
Google推出Gemini 3.5語音模型,自動過濾贅字與雜音首見 2026-08-27 · 5 報導 · 相似 0.83

Google擴充 Gemini 語音模型,瞄準會議紀錄、字幕、客服與語音控制等場景。語音轉文字在多人交談、背景噪音或發言遭打斷時容易失準,新模型則進一步理解上下文與專門術語,並可整理口語內容,降低後續人工校稿成本。

最新推出的 Gemini 3.5 Transcribe 支援超過 85 種語言,Google公布平均字詞錯誤率(WER)為 2.6%。模型可辨識最多三名說話者、自動刪除「嗯、啊」等語助詞,並支援即時翻譯及吵雜環境轉錄;不過目前支援清單未包含繁體中文。

Google發表三款Gemini新模型首見 2026-07-22 · 9 報導 · 相似 0.81

生成式 AI 競爭正從聊天機器人轉向可連續呼叫工具、執行多步任務的 AI 代理,企業因而更重視 Token 成本、回應速度與資安能力。Google 以 Gemini Flash 系列補強輕量模型陣容,藉此擴大 Gemini API 生態系並提高大規模部署的經濟性。

截至 2026 年 7 月 29 日,Google 發表 Gemini 3.6 Flash、3.5 Flash-Lite 與 3.5 Flash Cyber 三款模型,主打更快運算與更高 Token 效率。其中 Cyber 微調模型已進入漏洞修補試點;3.5 Pro 仍在測試,下一代 Gemini 4 則已啟動預訓練。

Google 發布 Gemini 3.5 Live Translate,實現 70 多種語言即時語音口譯首見 2026-06-10 · 4 報導 · 相似 0.83

Google 將 Gemini 3.5 的生成式 AI 能力延伸至即時口譯,核心是直接進行「語音對語音」翻譯,並保留說話者原有語調、節奏與表達方式。相較傳統先轉文字再合成語音的流程,新模型可縮短停頓,對跨國會議、旅遊及客服溝通具有重要性。

Google 最新發布 Gemini 3.5 Live Translate 音訊模型,可即時翻譯超過 70 種語言,並同步導入 Google 翻譯與 Google Meet,同時開放開發者預覽。Google 也已與東南亞叫車及外送平台 Grab 等夥伴展開測試,藉由實際服務場景驗證翻譯速度與自然度。

Google 推出 Gemini 3.1 Flash TTS 支援 70 種語言與場景導演首見 2026-04-16 · 2 報導 · 相似 0.80

Google 持續將 Gemini 多模態能力延伸至語音生成,讓開發者能為客服、影音配音與無障礙服務建立更自然的互動體驗。Gemini 3.1 Flash TTS 支援多語言及情緒控制,降低跨市場製作語音內容的門檻,對 AI 應用在地化尤其重要。

截至 2026 年 7 月 19 日,Google AI 開發者關係負責人 Logan Kilpatrick 宣布 Gemini 3.1 Flash TTS 上線。模型支援 70 種以上語言,開發者可用音訊標籤進行場景導演,調整情緒與表達方式;目前已開放於 Google AI Studio 體驗,並可透過 Gemini API 整合,相關定價尚未公布。

Google 推出 Gemini 3.1 Flash Live 並將 Search Live 推向全球逾 200 個國家首見 2026-03-27 · 2 報導 · 相似 0.85

Google自2025年9月先在美國推出Search Live,將生成式AI從文字搜尋延伸至語音與鏡頭連續追問。服務結合Google搜尋索引與AI Mode,可在對話中拆解問題並提供網頁連結,反映Google正以Gemini重塑核心搜尋入口;公司未公布本次部署的投資金額。

2026年3月26日,Google發布即時音訊模型Gemini 3.1 Flash Live,提升多語回應速度、自然度與穩定性,並同步將Search Live擴至AI Mode已上線的200多個國家與地區、支援98種語言。使用者可在Android或iOS版Google App點選Live,也能透過Google Lens以鏡頭搭配語音連續搜尋。

馬克雷達|MARK RADAR

習慣在 Google 搜新聞的話,可以把馬克雷達設為偏好來源,搜尋結果會更常出現本站的整理。在 Google 設為偏好來源 →

全站時間均為台北時間(GMT+8)