事件檔案
AI OpenAI
OpenAI 發布 GPT-Realtime-2:具備 GPT-5 推理能力的語音模型
5 篇報導 · 首次偵測 2026-05-08 · 最後活動 2026-05-08
分享圖 即時語音 Agent 不只要快速回話,還得在對話持續時理解意圖、記住脈絡、處理插話與修正,並可靠呼叫工具完成任務。OpenAI 此次把 GPT-5 級推理直接導入語音模型,意在縮小自然對談與實際執行間的落差,讓客服、旅遊及跨語言應用更接近可部署的工作介面。
OpenAI於2026年5月7日發布GPT-Realtime-2,並推出Realtime-Translate與Realtime-Whisper。主模型context window由32K增至128K,推理強度可選五級;翻譯支援逾70種輸入及13種輸出語言,音訊每百萬輸入、輸出token收費32及64美元。
全部報導
5 篇原始報導馬克翻舊帳
這個事件的歷史脈絡OpenAI 發布語音模型 GPT-Realtime-2.1
語音代理要能用於客服、銷售與助理場景,回應速度、辨識準確度及插話處理缺一不可;延遲過高會讓對話顯得不自然。OpenAI 因此以 GPT-Realtime-2 為基礎推出 GPT-Realtime-2.1,盼降低即時語音產品大規模部署的技術門檻。
截至2026年7月20日,OpenAI 已上線 GPT-Realtime-2.1,強化英數辨識、靜音與噪音處理及插話行為;相關報導稱延遲較前代至少降低 25%。模型支援 12.8 萬個 token 上下文、最高輸出 3.2 萬個 token,音訊每百萬 token 輸入、輸出分別為 32 美元與 64 美元。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。