Google发布TurboQuant算法 AI内存压缩达6倍
Google Research于3月24日发布TurboQuant内存压缩算法,可将AI模型键值缓存(KV Cache)压缩至少6倍,且不损失模型精度。该算法通过优化向量量化中的内存开销,显著降低大模型推理的内存需求,有望加速本地化AI Agent的部署。
Forbes分析认为,虽然单次推理所需内存减少,但更低的门槛将推动更多AI工作负载从云端转向本地,反而可能增加整体内存需求。摩根士丹利也指出,TurboQuant将带来更密集的算力需求而非削弱内存市场。
来源:Forbes

