大語言模型逐字自回歸生成,模型愈大、服務請求愈多,解碼成本與延遲就愈高。推測解碼先由輕量草稿器提出多個 Token,再交目標模型一次驗證;但聊天、程式碼與數學的輸出分布差異大,單一草稿架構難以在所有負載下維持效率。
騰訊混元 AI Infra 團隊於2026年7月29日發布並開源 AngelSpec v0.1.0,統一支援 MTP 與區塊平行推測解碼等6種草稿架構。測試顯示,DFly 在 Hy3-295B-A21B、併發量4至64下,較自回歸解碼加速1.98至2.40倍,吞吐量亦比 DFlash 高10.5%至11.8%。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。