馬克雷達MARK RADAR
關於
EN
登入

NVIDIA 發布 PyTorch 原生代理強化學習框架 Molt

1 篇報導 · 首次偵測 2026-08-02 · 最後活動 2026-08-02

代理強化學習讓 AI Agent 能透過回饋學會多輪對話、工具調用與程式碼執行,但既有大型框架層次複雜,研究員修改演算法、估計器或 Rollout 流程時,往往得同步調整訓練與分散式元件。NVIDIA NeMo 團隊因此打造 PyTorch 原生框架 Molt,以精簡、可追蹤的架構縮短研究迭代週期。

NVIDIA 研究團隊於 2026 年 7 月 22 日公開 Molt 論文與程式碼,並以 Apache 2.0 授權釋出。核心強化學習路徑約 8,600 行 Python,低於 verl 的約 62,000 行與 slime 的約 25,000 行;框架整合 Ray、vLLM、NeMo AutoModel 與 FSDP2,可在多節點 H100 叢集訓練多模態及 MoE Agent,實驗規模由 4B 稠密模型延伸至 700B MoE 模型。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)