NVIDIA 發表 KVTC 技術縮減 LLM 記憶體用量達 20 倍
1 篇報導 · 首次偵測 2026-03-21 · 最後活動 2026-03-21
大型語言模型推論時,會保存注意力機制產生的 Key-Value(KV)快取;面對長上下文或大量並行請求,快取容易占滿 GPU 記憶體,限制服務容量並推高企業採購或租用加速器的成本。輝達(NVIDIA)因此將降低 KV 快取占用,視為改善生成式 AI 基礎設施效率的關鍵。
NVIDIA 研究團隊最新發表「KV 快取轉換編碼」(KVTC),透過壓縮及編碼 KV 快取,在維持大型語言模型運作下,宣稱最高可將 GPU 記憶體用量縮減 20 倍,首次生成 Token 的速度則可提升最多 8 倍。截至 2026 年 7 月 20 日,NVIDIA 尚未公布商用時程與導入價格。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。