谷歌新论文把内存股价干崩了!KV cache压缩6倍,“谷歌的DeepSeek时刻”
梦晨 发自 凹非寺量子位 | 公众号 QbitAI学术会议ICLR居然和美光和西部数据大跌扯上关系了两家存储芯片巨头股价大跌没有财报暴雷没有供应链断裂只是谷歌展示了一篇即将在ICLR 2026正式亮相的论文。谷歌研究院推出TurboQuant压缩算法把AI推理过程中最吃内存的KV cache压缩至少6倍精度零损失。市场的解读简单粗暴长上下文AI推理以后不需要那么多内存了利空内存。网友纷纷表示这不就是美剧《硅谷》里的Pied PaperPied Piper是2014年开播的HBO经典美剧《硅谷》里的虚构创业公司核心技术就是一种“近乎无损的极限压缩算法”。2026年类似的算法在现实世界居然成真了。KVCache量化到3 bit要理解TurboQuant为什么重要先得理解它解决的是什么问题。AI大模型推理时处理过的信息会临时存在KV Cache方便后续快速调用不用每次从头算起。问题是随着上下文窗口越来越长内存消耗急剧膨胀。KV cache正在成为AI推理的核心瓶颈之一。传统的解决思路是向量量化把高精度数据压成低精度表示。但尴尬的是大部分量化方法本身也需要存储额外的“量化常数”每个数字要多占1到2个bit。TurboQuant用两个改动把这个额外开销干到了零。PolarQuant极坐标量化不用传统的X、Y、Z坐标描述数据转而用极坐标”距离角度”。谷歌团队发现转换后角度的分布非常集中且可预测根本不需要额外存储归一化常数。就像把“往东走3个路口往北走4个路口”压缩成”朝37度方向走5个路口”。信息量不变描述更紧凑还省掉了坐标系本身的开销。QJL量化JL变换把高维数据投影后压缩成1或-1的符号位完全不需要额外内存。TurboQuant用它来消除PolarQuant压缩后残留的微小误差。两者组合后PolarQuant先用大部分bit容量捕捉数据的主要信息QJL再用1个bit做残差修正。最终实现3-bit量化无需任何训练或微调精度零损失。8倍加速Benchmark全线拉满谷歌团队在Gemma和Mistral等开源模型上跑了主流长上下文基准测试覆盖问答、代码生成、摘要等多种任务。在“大海捞针”任务上TurboQuant在所有测试中拿下完美分数同时KV cache内存占用缩小了至少6倍。PolarQuant单独使用精度也几乎无损。速度提升同样显著。在英伟达H100 GPU上4-bit TurboQuant计算注意力分数的速度比32-bit未量化版本快了8倍。不只是省内存还更快了。在向量搜索领域TurboQuant同样超越了现有最优量化方法的召回率而且不需要针对具体数据集做调优也不依赖低效的大码本。AI内存的DeepSeek时刻Cloudflare CEO评价“这是谷歌的DeepSeek时刻”。他认为DeepSeek证明了用更少的资源也能训出顶尖模型。TurboQuant的方向类似用更少的内存也能跑同样质量的推理。谷歌表示TurboQuant除了可以用在Gemini等大模型上同时还能大幅提升语义搜索的效率让谷歌级别的万亿级向量索引查询更快、成本更低。不过TurboQuant目前还只是一个实验室成果尚未大规模部署。更关键的是它只解决推理阶段的内存问题。而AI训练环节完全不受影响。论文地址https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/参考链接[1]https://x.com/eastdakota/status/2036827179150168182?s20—欢迎AI产品从业者共建—「AI产品知识库」是量子位智库基于长期产品库追踪和用户行为数据推出的飞书知识库旨在成为AI行业从业者、投资者、研究者的核心信息枢纽与决策支持平台。一键关注 点亮星标科技前沿进展每日见