NVIDIA 發布 Cosmos 3 與 Nemotron 3 Ultra 推動開源實體 AI 生態
實體 AI 要讓機器人、自駕車與視覺代理理解環境並採取行動,長期受限於真實訓練資料不足及模擬工具分散。NVIDIA 將世界模型與代理推理模型開放權重、資料及訓練配方,意在降低開發門檻,並把 GPU、DGX Cloud 與軟體工具納入共同生態。
2026年5月31日,NVIDIA 於 GTC Taipei 發布 Cosmos 3,原生整合文字、影像、影片、環境聲音與動作,並與 Runway 等成立 Cosmos Coalition;6月4日再釋出 Nemotron 3 Ultra,總參數 5,500 億、啟用 550 億,推論吞吐最高增至 5 倍,代理任務成本最多降低 30%。
全部報導
2 篇原始報導馬克翻舊帳
這個事件的歷史脈絡NVIDIA 發布 Cosmos 3 Edge 輕量級端側世界模型
世界模型可協助機器理解環境、預測後續狀態並採取行動,是機器人、自駕與智慧基礎設施發展實體 AI 的核心技術。NVIDIA 的 Cosmos 3 系列整合文字、影像、影片、環境聲音與動作;Edge 版本主打低延遲在地運算,降低裝置仰賴雲端或資料中心的限制。
NVIDIA 於 2026 年 7 月 20 日發布 Cosmos 3 Edge,模型規模為 40 億參數,內含可獨立運行的 20 億參數推理模組。在 Jetson Thor 上,模型能以 640×360 解析度、每次推理產生 32 個動作,支援 15 Hz 即時控制,並可部署於 Jetson、RTX PRO、GeForce RTX 與 DGX 系統;模型已在 Hugging Face 開放,推理及後訓練工具則發布於 GitHub。
NVIDIA 發表 Nemotron 3 Nano Omni 開源多模態模型
目前 AI agent 通常分別呼叫視覺、語音與語言模型,資料轉接不僅增加延遲,也可能遺失脈絡。NVIDIA 將影音、影像、文字與文件理解整合至單一開放模型,鎖定電腦操作、客服及監控等應用,攸關企業部署成本與 AI 軟體生態競爭。
2026 年 4 月 28 日,NVIDIA 發布 Nemotron 3 Nano Omni;模型採 30B-A3B 混合專家架構,總參數 300 億、推論時約啟用 30 億,支援 256K 脈絡。官方稱吞吐量最高可達同類開放模型 9 倍;鴻海科技集團、Palantir 等 7 家業者已採用。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。