馬克雷達MARK RADAR
關於
EN
登入

AllenAI 開源 Tulu 3 後訓練流程:結合 SFT 與 RLVR 強化模型評估

1 篇報導 · 首次偵測 2026-08-13 · 最後活動 2026-08-13

Ai2 以 Llama 3.1 基礎模型打造 Tulu 3,並將資料、權重、訓練配方及評估工具開源,降低大型語言模型後訓練的黑箱程度。流程依序導入監督式微調(SFT)、直接偏好最佳化(DPO)與可驗證獎勵強化學習(RLVR),兼顧指令遵循、偏好對齊及數學推理。

Ai2 於2024年11月22日公開 Tulu 3 技術堆疊;最新教學以 Open Instruct 重現三階段流程,納入 GRPO 與 verifier 評估,並將多 GPU 設定縮至約16GB單機環境。官方測試顯示,RLVR 較 DPO 在 MATH、GSM8K、IFEval 最多提升1.7、3.3、1.3分;8B GRPO模型於2025年2月12日發布。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)