NVIDIA 發布 PyTorch 原生代理強化學習框架 Molt
1 篇報導 · 首次偵測 2026-08-02 · 最後活動 2026-08-02
代理強化學習讓 AI Agent 能透過回饋學會多輪對話、工具調用與程式碼執行,但既有大型框架層次複雜,研究員修改演算法、估計器或 Rollout 流程時,往往得同步調整訓練與分散式元件。NVIDIA NeMo 團隊因此打造 PyTorch 原生框架 Molt,以精簡、可追蹤的架構縮短研究迭代週期。
NVIDIA 研究團隊於 2026 年 7 月 22 日公開 Molt 論文與程式碼,並以 Apache 2.0 授權釋出。核心強化學習路徑約 8,600 行 Python,低於 verl 的約 62,000 行與 slime 的約 25,000 行;框架整合 Ray、vLLM、NeMo AutoModel 與 FSDP2,可在多節點 H100 叢集訓練多模態及 MoE Agent,實驗規模由 4B 稠密模型延伸至 700B MoE 模型。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。