谷歌推出TurboQuant 实现AI内存6倍压缩
谷歌研究院发布AI压缩算法TurboQuant,可将大语言模型的键值缓存(key-value cache)压缩至3bit精度,实现约6倍内存压缩和最高8倍性能提升,且基本不损失模型准确率。该算法采用名为PolarQuant的技术,将向量从传统XYZ坐标转换为极坐标系统,仅保留半径(数据强度)和方向(数据含义)两个维度,大幅降低存储需求。
测试涵盖Gemma、Mistral等主流开源模型,均在英伟达H100加速器上验证。TurboQuant无需重新训练或微调模型即可应用,还可用于大规模搜索引擎的向量检索。
谷歌计划在4月的ICLR 2026会议上正式展示该技术。
来源:Ars Technica

