傳統語音代理多以語音轉文字、語言模型與文字轉語音串接,交接會增加延遲,也容易在停頓或插話時失去節奏。OpenAI 於 2026 年 7 月 8 日先在 ChatGPT 推出 GPT‑Live,GPT‑Live‑1 因可同步聆聽與說話,成為語音客服與助理的重要基礎。
OpenAI 於 2026 年 9 月 10 日把 GPT‑Live‑1 開放至 API,前端語音層定價每分鐘 0.05 美元。模型強化指令遵循、插話處理與長時間對話,支援 WebRTC、WebSocket 及電話系統,並擴增口音、方言與語言選項;自訂語音須聯絡業務申請。
全部報導
2 篇原始報導馬克翻舊帳
這個事件的歷史脈絡OpenAI 推出 ChatGPT 語音大升級,搭載 GPT-Live 模型
OpenAI 將 ChatGPT Voice 從分段輪流對話,推進到 GPT-Live 驅動的全雙工互動:模型可同步聆聽與說話,並在需要搜尋或推理時交由 GPT-5.5 處理。這可降低停頓與誤判插話,也讓語音成為操控 AI 代理的介面;OpenAI 稱每週逾 1.5 億人使用 Voice 或 Dictation。
OpenAI 於 2026 年 7 月 8 日向全球用戶推出 GPT-Live,7 月 23 日再將語音擴至 macOS、Windows 桌面版 Work 與 Codex,可口頭啟動、插話、改向並協調多個代理。Business 額外語音每分鐘 5 credits,Work/Codex 約 6 credits。
團隊開發 GPT-Live 即時語音 AI 系統架構
過往語音 AI 不是串接語音轉文字、LLM 與文字轉語音,就是靠 turn detector 判斷誰該發言,常因停頓或雜音誤判。OpenAI 第三代語音系統 GPT-Live 改採 full-duplex,可同步聆聽與說話,並將深度推理移出即時音訊路徑,讓 ChatGPT Voice 兼顧自然互動、智慧與規模。
OpenAI 於2026年8月3日公開六個月開發細節,未披露投入金額。團隊以 Go 取代 Python asyncio,使新系統音訊幀傳送的 p95 達舊版 p50 水準;WARP 並將啟動流程由6次網路往返減至1次,複雜任務則非同步交給 GPT-5.5。這套架構已用於7月8日推出的新版 ChatGPT Voice。
OpenAI 推出全新語音模型 GPT-Live 支援全雙工對話
人工智慧龍頭OpenAI於2026年持續領跑科技業,其估值已達1500億美元。過去語音助理受限於半雙工架構,使人機對話存在明顯延遲。此次推出支援全雙工的GPT-Live,旨在打破傳統對話限制,讓AI語音邁向即時同步對話的全新時代,這對於推動全球百億美元規模的語音客服市場具有指標性意義。
OpenAI於2026年7月16日正式上線語音模型GPT-Live-1與mini版,首波向每月20美元的Plus會員開放。該模型實現同時聽說與適時插話的真人對話體驗,並將語音互動與推理層分離,複雜任務委派給背景執行的GPT-5.5處理。官方展示中,AI已能同步處理訂機票、天氣查詢與行程規劃等多工作業。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。