vLLM 是聚焦大型語言模型部署的開源推論引擎,透過 KV cache 管理降低顯示記憶體占用。隨 DeepSeek V4 等 MoE 模型規模擴大,能否在 NVIDIA Blackwell 與 GB200 平台兼顧吞吐量與成本,已成為企業部署關鍵。
vLLM 最新推出 v0.20,主打提升記憶體效率與 MoE 推論效能,並加入 DeepSeek V4 支援;硬體生態系也正針對 NVIDIA Blackwell、GB200 深度優化。現有事件資料未載明確切發布日期、效能增幅、價格或投資金額。
全部報導
2 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。