馬克雷達MARK RADAR
EN

NVIDIA 發表 KVTC 技術縮減 LLM 記憶體用量達 20 倍

1 篇報導 · 首次偵測 2026-03-21 · 最後活動 2026-03-21

大型語言模型推論時,會保存注意力機制產生的 Key-Value(KV)快取;面對長上下文或大量並行請求,快取容易占滿 GPU 記憶體,限制服務容量並推高企業採購或租用加速器的成本。輝達(NVIDIA)因此將降低 KV 快取占用,視為改善生成式 AI 基礎設施效率的關鍵。

NVIDIA 研究團隊最新發表「KV 快取轉換編碼」(KVTC),透過壓縮及編碼 KV 快取,在維持大型語言模型運作下,宣稱最高可將 GPU 記憶體用量縮減 20 倍,首次生成 Token 的速度則可提升最多 8 倍。截至 2026 年 7 月 20 日,NVIDIA 尚未公布商用時程與導入價格。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)