推理型模型的門檻不只在算力,更在於能否把思考軌跡整理成可訓練資料。SupraLabs 的 reasoning-corpus-4K-5M-v1 匯集多個模型生成的推理樣本,保留來源、估算長度、提示、推理過程、答案及 ChatML 欄位,讓小型語言模型也能進行 SFT 與推理蒸餾。
截至 2026 年 8 月 14 日,教學以 Hugging Face 串流讀取語料,先剔除空白與長度不符資料,再轉為對話式 SFT 格式;訓練端選用 SmolLM2,透過 LoRA 僅更新少量參數。流程建議以 128 至 4,096 tokens 篩選,單一 GPU 從 4,096 筆 shuffle buffer 起步,並於正式訓練前人工抽查樣本。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。