馬克雷達MARK RADAR
關於
EN
登入

騰訊開源 AngelSpec 框架 提升大模型推測解碼與推理效率

1 篇報導 · 首次偵測 2026-07-30 · 最後活動 2026-07-30

大語言模型逐字自回歸生成,模型愈大、服務請求愈多,解碼成本與延遲就愈高。推測解碼先由輕量草稿器提出多個 Token,再交目標模型一次驗證;但聊天、程式碼與數學的輸出分布差異大,單一草稿架構難以在所有負載下維持效率。

騰訊混元 AI Infra 團隊於2026年7月29日發布並開源 AngelSpec v0.1.0,統一支援 MTP 與區塊平行推測解碼等6種草稿架構。測試顯示,DFly 在 Hy3-295B-A21B、併發量4至64下,較自回歸解碼加速1.98至2.40倍,吞吐量亦比 DFlash 高10.5%至11.8%。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)