谷歌 TurboQuant 打破 AI 内存限制 — 6倍压缩,零精度损失,无需重新训练

新闻摘要
2026年3月25日(美国东部时间)星期二,Google Research 正式发布了 TurboQuant,这是一种下一代压缩算法,旨在大幅减少大型语言模型的内存占用,同时不牺牲任何准确性。该公告发布在 Google Research 博客上,并将于下个月在巴西里约热内卢举行的国际学习表示会议(ICLR 2026)上正式发表。
什么是 TurboQuant?
TurboQuant 是一种两阶段向量量化压缩方法,旨在解决现代 AI 推理中最持久的瓶颈之一:键值(KV)缓存。这是大型语言模型在处理摘要、问答和代码生成等长上下文任务时所依赖的“工作内存”。通过将此缓存压缩至少 6 倍,TurboQuant 使 AI 系统能够更快、更便宜、更大规模地运行——所有这些都无需进行任何模型重新训练或微调。
TurboQuant 背后的两大核心技术
TurboQuant 通过 Google Research 开发的两种新颖、互补的方法实现了卓越的效率。
第一种技术 PolarQuant 重新构想了向量数据的几何存储方式。PolarQuant 不依赖于标准的笛卡尔坐标,而是将数据向量转换为极坐标形式——在随机旋转后将其映射到固定的圆形网格上。由于转换后角度的分布变得高度可预测,该系统无需存储昂贵的归一化常数,从而大大降低了内存开销。
第二种技术 量化 Johnson-Lindenstrauss (QJL) 充当数学误差检查器。即使经过 PolarQuant 压缩,仍然存在少量残余误差。QJL 对这些剩余数据应用 1 位纠正层,消除了量化偏差,并确保注意力分数保持准确。其结果是一个近乎无损的压缩流程,运行时开销可忽略不计。
令业界震惊的性能结果
Google 在包括 Gemma 和 Mistral 在内的开源模型上进行的内部基准测试,在具有挑战性的长上下文任务中取得了令人印象深刻的结果。TurboQuant 成功地将 KV 缓存量化到仅 3 位——内存使用量减少了至少 6 倍——在所有测试的基准测试中,包括 LongBench、Needle In A Haystack、ZeroSCROLLS、RULER 和 L-Eval,准确性零损失。
也许最引人注目的是原始速度的提升:在 NVIDIA H100 GPU 加速器上,与 32 位未量化的键相比,TurboQuant 的 4 位实现将计算注意力对数(logits)的性能提升了 8 倍。独立社区研究人员在公告发布后 24 小时内复现了类似的结果,对 Qwen3.5-35B 模型进行的早期基准测试显示,在 8,500 到 64,000 个 token 的上下文长度范围内,匹配度达到 100%。
市场反应:内存芯片股票受挫
该公告的连锁反应立即在华尔街显现。在 Google 周二(美国东部时间)发布消息后,包括美光、SK 海力士、三星电子和西部数据在内的主要内存半导体公司的股价明显下跌,因为分析师开始重新评估对高带宽内存(HBM)长期需求的假设。其逻辑很简单:如果 AI 公司仅通过软件创新就能将内存需求减少六倍,那么对昂贵硬件升级的需求可能会大大减缓。
然而,一些分析师迅速指出,TurboQuant 只针对推理内存,而非训练内存——而训练工作负载仍然需要大量的 RAM,这使得芯片长期需求前景变得不那么明朗。
“Google 的 DeepSeek 时刻”
科技界对此反应不一,既有敬畏也有兴奋。Cloudflare 首席执行官 Matthew Prince 将 TurboQuant 与 DeepSeek 的效率突破相提并论,称之为“Google 的 DeepSeek 时刻”。Google Research 的原始公告在 24 小时内获得了 X(前身为 Twitter)上超过 770 万次的观看量,社区开发者争相将该算法移植到流行的本地 AI 框架,如适用于 Apple Silicon 的 MLX 和 llama.cpp。
互联网也迅速抓住了与 HBO 电视剧《硅谷》中虚构的压缩初创公司 Pied Piper 的比较,指出 TurboQuant 极端的、近乎无损的压缩几乎正是该剧所描绘的那种突破。
对 AI 行业意味着什么
TurboQuant 的发布标志着 2026 年 AI 发展方向的一个关键信号。Google 没有追求需要更多计算能力、越来越大的模型,而是表明数学的优雅和算法创新可以带来显著的效率提升。这项技术对于新兴的智能体 AI 系统时代尤其有前景,这些系统需要大型、可搜索且持久的向量内存来处理复杂的多步任务。
至关重要的是,TurboQuant 是在一个开放研究框架下发布的,这意味着开发者和公司可以开始将其原理集成到自己的系统中。然而,这仍然是一个实验室的突破——大规模的全面生产部署仍然是更广泛行业将密切关注的下一步。