研究突破

Google 發表 TurboQuant:以 3-bit 壓縮重新定義 AI 推理效率

GoogleResearch公開了一項名為TurboQuant的全新量化技術,主張可將大型語言模型(LLM)的key-value(KV)快取壓縮至3bits,同時在不需要額外訓練或微調的情況下維持模型精度。

Google Research 公開了一項名為 TurboQuant 的全新量化技術,主張可將大型語言模型(LLM)的 key-value(KV)快取壓縮至 3 bits,同時在不需要額外訓練或微調的情況下維持模型精度。

現有 AI 推理系統在處理長上下文及代理工作負載時,往往受制於 KV 快取佔用大量 GPU 記憶體的問題,成本居高不下。TurboQuant 聲稱可將 KV 記憶體需求縮小至少六倍,在 NVIDIA H100 硬件上,其 4-bit 版本對 attention 計算可帶來最高達八倍的速度提升。

研究團隊在多個長上下文評測基準上驗證了 TurboQuant 的效果,涵蓋針對長文理解、信息檢索及多輪問答等不同測試場景。若這項技術能在實際部署中得到廣泛驗證,將有助於大幅降低 AI 推理的硬件成本,令企業以更低門檻運行長上下文應用,對整個行業的成本結構具有潛在深遠影響。

返回 AI 資訊