馬克雷達MARK RADAR
關於
EN
登入

SupraLabs推理型LLM微調教學:從資料清理到LoRA訓練

1 篇報導 · 首次偵測 2026-08-14 · 最後活動 2026-08-14

推理型模型的門檻不只在算力,更在於能否把思考軌跡整理成可訓練資料。SupraLabs 的 reasoning-corpus-4K-5M-v1 匯集多個模型生成的推理樣本,保留來源、估算長度、提示、推理過程、答案及 ChatML 欄位,讓小型語言模型也能進行 SFT 與推理蒸餾。

截至 2026 年 8 月 14 日,教學以 Hugging Face 串流讀取語料,先剔除空白與長度不符資料,再轉為對話式 SFT 格式;訓練端選用 SmolLM2,透過 LoRA 僅更新少量參數。流程建議以 128 至 4,096 tokens 篩選,單一 GPU 從 4,096 筆 shuffle buffer 起步,並於正式訓練前人工抽查樣本。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)