馬克雷達MARK RADAR
關於
EN
登入
事件檔案 AI OpenAI

OpenAI 發布 GPT-Realtime-2:具備 GPT-5 推理能力的語音模型

5 篇報導 · 首次偵測 2026-05-08 · 最後活動 2026-05-08

即時語音 Agent 不只要快速回話,還得在對話持續時理解意圖、記住脈絡、處理插話與修正,並可靠呼叫工具完成任務。OpenAI 此次把 GPT-5 級推理直接導入語音模型,意在縮小自然對談與實際執行間的落差,讓客服、旅遊及跨語言應用更接近可部署的工作介面。

OpenAI於2026年5月7日發布GPT-Realtime-2,並推出Realtime-Translate與Realtime-Whisper。主模型context window由32K增至128K,推理強度可選五級;翻譯支援逾70種輸入及13種輸出語言,音訊每百萬輸入、輸出token收費32及64美元。

全部報導

5 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡
OpenAI 發布語音模型 GPT-Realtime-2.12026-07-07 · 1 報導 · 相似 0.86

語音代理要能用於客服、銷售與助理場景,回應速度、辨識準確度及插話處理缺一不可;延遲過高會讓對話顯得不自然。OpenAI 因此以 GPT-Realtime-2 為基礎推出 GPT-Realtime-2.1,盼降低即時語音產品大規模部署的技術門檻。

截至2026年7月20日,OpenAI 已上線 GPT-Realtime-2.1,強化英數辨識、靜音與噪音處理及插話行為;相關報導稱延遲較前代至少降低 25%。模型支援 12.8 萬個 token 上下文、最高輸出 3.2 萬個 token,音訊每百萬 token 輸入、輸出分別為 32 美元與 64 美元。

馬克雷達|MARK RADAR

習慣在 Google 搜新聞的話,可以把馬克雷達設為偏好來源,搜尋結果會更常出現本站的整理。在 Google 設為偏好來源 →

全站時間均為台北時間(GMT+8)