OpenAI 推出新一代低延遲語音模型 GPT-Realtime-2.1,使語音延遲較前代下降至少 25%。此模型優化了快取機制與語音辨識度,旨在解決語音代理的可用性瓶頸,推動語音產品進入大量部署階段。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡OpenAI 發布 GPT-Realtime-2:具備 GPT-5 推理能力的語音模型
即時語音 Agent 不只要快速回話,還得在對話持續時理解意圖、記住脈絡、處理插話與修正,並可靠呼叫工具完成任務。OpenAI 此次把 GPT-5 級推理直接導入語音模型,意在縮小自然對談與實際執行間的落差,讓客服、旅遊及跨語言應用更接近可部署的工作介面。
OpenAI於2026年5月7日發布GPT-Realtime-2,並推出Realtime-Translate與Realtime-Whisper。主模型context window由32K增至128K,推理強度可選五級;翻譯支援逾70種輸入及13種輸出語言,音訊每百萬輸入、輸出token收費32及64美元。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。