NVIDIA發佈 VoiceChat 11B 即時雙工語音 AI 模型
1 篇報導 · 首次偵測 2026-08-10 · 最後活動 2026-08-10
NVIDIA 推出的 NemotronLabs VoiceChat 11B,是一款擁有 110 億參數的端對端語音對語音模型。它不再串接語音辨識、大型語言模型與語音合成等多套系統,目標是簡化語音代理架構,並讓 AI 能像真人一樣邊說邊聽、自然處理插話。
截至 2026 年 8 月 10 日,NVIDIA 已開放 VoiceChat 11B 的模型權重供研究與測試。該模型可將輪替發言延遲壓低至約 450 毫秒,支援即時雙工對話及動態工具調用;部署環境至少需要配備 80GB VRAM 的 GPU,顯示其運算門檻仍偏高。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。