研究突破
Google 發表 TurboQuant:以 3-bit 壓縮重新定義 AI 推理效率
GoogleResearch公開了一項名為TurboQuant的全新量化技術,主張可將大型語言模型(LLM)的key-value(KV)快取壓縮至3bits,同時在不需要額外訓練或微調的情況下維持模型精度。
GoogleResearch公開了一項名為TurboQuant的全新量化技術,主張可將大型語言模型(LLM)的key-value(KV)快取壓縮至3bits,同時在不需要額外訓練或微調的情況下維持模型精度。
Google公開全新TurboQuant演算法,在不犧牲準確度的前提下,KV快取記憶體消耗降低6倍,注意力機制計算速度提高8倍,為大型AI模型運算效率樹立新標竿。
Google Research 發布 TurboQuant 壓縮演算法,能將大型語言模型的 KV 快取記憶體壓縮至 3 位元,實現最高 6 倍記憶體縮減與 8 倍速度提升,且不損失模型準確率。此研究成果將於 ICLR 2026 正式發表。