暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

专访RaBitQ作者龙程、高健扬:谷歌TurboQuant学术不端,全球存储暴跌更是虚惊一场

ZILLIZ 2026-04-09
57
近期,谷歌发布了一篇名为 TurboQuant 的论文,宣称可实现向量 “6 倍压缩、8 倍加速、0 准确率损失”。该论文一经发布,便引发全球存储企业股价暴跌,登上一众科技媒体头版头条。
但很快,这篇论文就被学界指出存在成果严重夸大、对 RaBitQ 核心成果引用与评价不规范等问题。这场风波,也让向量量化 这项对向量数据库检索、大模型 KV Cache 性能至关重要的技术,再度成为行业关注焦点。
作为全球在向量量化工程实践领域探索最深、最早对 RaBitQ 完成系统性适配与深度优化的团队,Zilliz 特邀新加坡南洋理工大学副教授、VectorDB@NTU 负责人龙程,RaBitQ 第一作者高健扬博士,以及 Zilliz 工程总监刘力,围绕此次事件展开深度对谈。
核心内容包括但不限于:
  • TurboQuant引起全球存储暴跌,是虚惊一场。
  • TurboQuant为什么没有作者宣传的那么厉害?它的学术操作到底有什么问题?
  • RaBitQ 对向量量化技术到底有什么贡献?
  • 向量量化技术的未来是什么?它走到尽头了吗?

01

向量量化是未来,但TurboQuant引起全球存储暴跌,是虚惊一场

Zilliz龙教授可以先科普下向量量化是什么,为什么在大模型时代突然火了。
龙程:向量量化是一种数据压缩与近似表示技术,最早起源于信号处理领域,过去主要用在图像、语音压缩方面。现在,大模型已经把向量(vector)变成了 AI 基础设施的底层语言。例如:大模型的输入是向量;从知识库(如 RAG 系统)中检索的也是向量;模型参数本身是向量;甚至中间计算状态(例如 KV cache)同样以向量形式存在。

在这样的背景下,我们经常需要对向量进行压缩或量化(quantization),以降低存储成本、减少带宽占用,并提升计算效率。下面我举两个典型的向量量化应用场景。

一是向量数据库的百亿级向量实时检索。语义检索的本质,就是向量数据库对高维向量做相似性检索。但原始高维向量体积大、浮点计算慢,百亿级数据下无法实现毫秒级实时响应。向量量化能将其压缩为低比特整数,同时大幅加速距离计算,让百亿级向量实时检索成为可能。
二是大模型 KV Cache 压缩,解决长上下文推理的显存瓶颈KV cache 本质上是用存储换计算,它能通过缓存大模型历史生成的 key/value 向量,将大模型生成的注意力计算复杂度从 O (n²) 降至 O (n),解决了计算冗余问题。但海量 K/V 向量会迅速占满 GPU 显存,而如何在尽量不损失模型输出质量的前提下压缩 KV cache,本质上也是一个向量量化问题。
Zilliz:那向量量化普及,以及TurboQuant 的论文成果,会带来存储暴跌嘛?
高健扬:KV cache 压缩下来,相同模型和场景下,需要的存储的确少了。但向量量化技术,其实早在前两年,就已经接近或达到了理论极限。谷歌 TurboQuant 说的 "6 倍压缩、8 倍加速",是跟最基础的 16 比特比,跟同类技术比,其真实效果还需要进一步检验。
Zilliz:所以存储跌晚了,早在几年前RaBitQ出来时候,就该跌了?
龙程:技术角度是跌晚了,毕竟类似的理论效果,行业其实早就达到了。但是学界到工程再到大众财经媒体,是有时差的,在专业技术方面,资本市场的反应经常会迟滞一点。
但长期一点,从市场角度看,量化能让更小设备也能跑大模型,反而会创造新的存储需求。技术对市场的影响很复杂,我们不能搞线性外推。

02

RaBitQ:从理论到实践的里程碑

Zilliz:您当初是怎么想到RaBitQ这个方向的?
高健扬:我们研究向量数据库时发现,PQ (Product Quantization,乘积量化)这类传统算法工程效果还行,但几乎没有理论保证。当时我正好在新加坡南洋理工大学学高维概率论,发现高维空间有很多漂亮的性质,就想做一个既有理论最优保障,又能真正落地的方法。
Zilliz:RaBitQ 的核心贡献和独创性在哪里?
高健扬:用随机旋转(Johnson–Lindenstrauss transformation)让向量坐标分布均匀且可预测,基于此推导出最优量化估计器,然后严格证明它达到了理论最优下界
当然,过去也有人尝试过引入随机旋转,但算法设计上有一点问题,没有达到理想的效果。
Zilliz刘力可以从工程角度聊聊,RaBitQ最让你惊艳的点是什么?
刘力:我们几乎接触过市面上所有的量化算法,从最早的 SQ 到 PQ、PRQ 等等。但直到RaBitQ 开始,大家才真正用数学的方式解决问题,非常的优美、非常大道至简。之前都是经验主义,"我觉得这个方案好",但不知道为什么好。这个思路影响了整个行业,后来很多算法都能看到 RaBitQ 的影子。
Zilliz:更直白地说,它能节约多少内存和成本?
刘力:相同召回率下,从 4 比特压缩到 2 比特,内存直接省一半。而且性能比 PQ 好,召回率比 SQ 好,是个不折不扣的六边形战士。
Zilliz目前 RaBitQ 除了 Milvus 之外,龙教授观察到还有哪些产品在使用RaBitQ ?
龙程:首先特别感谢 Milvus,因为你们是最早一批使用 RaBitQ 的,大家私下也有过很多沟通交流与合作研究。大厂里 Meta FAISS、微软 Disk ANN、苹果,国内字节、阿里、腾讯、蚂蚁OceanBase,基本都在用。开源生态里 Elasticsearch、OpenSearch 这些主流向量数据库也都集成了。

03

如何评价TurboQuant 成果,及其团队的表现

Zilliz具体到谷歌的 TurboQuant 论文,这它有哪些不规范的地方?
高健扬:三个核心问题。
第一,错误描述前人工作,回避相似性:TurboQuant论文在核心技术点如随机旋转上,和RaBitQ是几乎一样的。2025 年 1 月TurboQuant文章作者Majid Daliri还曾找我们帮助他实现基于 RaBitQ C++ 代码的 Python 版本,结果论文里完全回避相关的讨论。2025 年 4 月他们发布预印本,5 月我们注意到问题并发邮件澄清,然后他们就停止了回复。后续ICLR审稿人独立指出需要与 RaBitQ 进行对比和更充分讨论之后,在最终版论文中,他们反而把仅有的不完整讨论移到了附录
第二,歪曲理论成果。一篇论文里任何一个论点都应该有证据的支撑。但他们没有提供任何推导、对比或证据支撑,毫无证据就说 RaBitQ 是 "次优",尽管我们的扩展版论文早就证明RaBitQ 的空间和误差的 trade-off 达到了理论最优下界,还因此被邀请到理论计算机科学顶会 FOCS 的 workshop 上做报告。
第三,对比实验不公平测试 RaBitQ的时候 ,他们选择使用单核 CPU 关多线程,而测试TurboQuant的时候却用了有上千个计算核心的A100 GPU,再加上 Python 代码和 C++ 代码之间的区别,导致实验结果与实际性能差了超过 10 万倍。
龙程:另外TurboQuant这个论文对前人成果的评价非常武断。举个例子,论文里说"RaBitQ不能做向量化计算(cannot be vectorized)"。但事实上RaBitQ早在2024年论文发表的时候,就开源了代码,包含了基于SIMD的向量化计算。这个情况作者应该也是知道的,但仍然作上面的论断,不得不怀疑他们有恶意动机。另外值得一说的是我们去年开始跟英伟达合作,也完成了RaBitQ的GPU实现,已经取得了很好的效果,相关代码正在英伟达 cuVS 库的审核阶段。
Zilliz2025年下半年,刘力你带着Milvus团队就评估过TurboQuant,为什么最后没用?
刘力:它的可取之处,是在量化网格分配上做了点小优化,但最核心的随机旋转用于量化是 RaBitQ 首创的。无偏估计方面,RaBitQ 的方案要优雅得多,理论推导也强得多。但毕竟是谷歌的成果,所以我们去年 5 月就测了,结果是在我们实验室统一 CPU 环境下,多数case里跑不过我们内部的RBQ版本。所以,今年大家市场对TurboQuant反应这么大,我们还挺惊讶的。
Zilliz:能不能用通俗的语言概括一下 RaBitQ 和 TurboQuant 的算法步骤以及它们的相似性?
刘力第一步都是随机旋转。在数学上可以看做将向量与一个随机正交矩阵相乘。相当于在高维空间换个观测视角,不改变数据相对位置,解决了原始向量维度信息分布不均的问题。
第二步是量化:将连续实数空间离散化为 2^k 个均匀网格(k 为量化比特数),每个向量元素就近映射到最近网格点。TurboQuant 在这里做了点小优化, 按数据分布分配网格,不是平均分配。
第三步是误差估计,这才是 RaBitQ 的核心:传统算法直接使用量化后的离散值计算,会导致误差不可控,RaBitQ 能精确估计量化误差,是数学上的最优解;TurboQuant 的方案更复杂,但在我们场景下性价比可能没那么高。
Zilliz在你们发表公开声明后,谷歌和 ICLR 方面有什么回应吗?
龙程:ICLR 我们去年9月审稿期间就发了邮件,但没得到回应。今年3月,我们再发邮件,也只让我们去 open review 发评论,没别的动作。
谷歌方面,前几天二作做了回复,只是表示会修正arXiv版本中对RaBitQ的最优性的不准确性描叙;除此之外,基本上回避了我们提出的问题,甚至还暗示我们是蹭热度。我们对此表示比较失望。
Zilliz之前是学术不端,现在已经是阴阳和霸凌了。为什么维权这么难?公司借鉴学术成果有什么约束条件吗?
龙程:现在 AI 会议规模太大了,一次投稿上万篇,组织者没有精力处理每一个类似的事情。而谷歌是大公司,有强大的发声渠道,我们与他们的话语权根本不匹配
高健扬:对个人来说太耗精力了,我和龙老师最近几周几乎没法正常工作。我们在这个过程中实际上已经经历了非常多挫折,联系作者被强硬拒绝,联系会议组织者没有收到回复。现实中很多独立研究者对这些事 "忍一忍就过去了",但很多创新成果就是这么被淹没了的
Zilliz对你们团队来说,这种“使用不太规范”,似乎已经不是一次两次了。
龙程:对,我们之前也遇到过一些情况,有些公司在RaBitQ的基础上,做一些工程上的修修补补,然后给方法取一个新的名字;介绍方法的时候,只是简单说一下"inspired by RaBitQ"。这背后可能有很多因素,有人的因素,也有算法创新与工程实践之间的署名边界越来越模糊的因素。与之相对的是,也有很多工业界的朋友,包括Milvus,做得就非常专业,在用RaBitQ的时候,能够客观地描述她,并且使用的过程中,如果用到原本版本以外的其他的一些优化的技术,也讲清楚,这样既可以公正地给到原创者credits,又能体现公司在工程上的技术实力,就是一个很专业,同时皆大欢喜的事情。
Zilliz大厂使用学术研究成果,会提供利益分配吗?
高健扬:绝大多数情况下是不需要的。尽管如此,大厂仍然有动机向公众宣传是自己创造了技术进步而非采用了别人的成果,实际上大家都希望向公众宣传最前沿的技术是自己团队创新的,这样能在客户和投资人面前获得优势。

04

向量量化技术的未来

Zilliz:两位现在有什么正在做的新研究方向?
龙程:接下来我们相当大一部分精力还是会放在向量检索上,比如把RaBitQ与不同向量检索索引(如 IVF、HNSW)结合,支持更大规模的向量数据,做到更低的延迟、更高的并发和更低的成本。另外,我也在关注KV cache 压缩相关内容。
高健扬:大模型KV cache 和向量检索,数学上、系统上都共享所有高维空间内向量的性质,后续我会思考怎么把高维概率在内的数学经验,用在模型的推理和训练加速
Zilliz:向量量化这个方向的天花板在哪里?还有多大的发展空间?
龙程理论天花板基本摸到了,RaBitQ 已经是渐进最优。但工程上空间还很大,因为你还需要考虑硬件特性、数据分布、延迟约束等各种因素。
阅读推荐
谷歌TurboQuant论文被指控背后,VQ如何成为显学,VDB的极致降本是如何实现的?

黄仁勋GTC演讲上,Milvus为什么能站稳非结构化数据处理C位
2026 年,Embedding要怎么选?(实测Gemini 、jina、Qwen、BGE、OpenAI十大模型)
Claude Code 的记忆系统,比想象中初级
养虾实战教程:我用OpenClaw做了个能盯盘,也能深度复盘的投资agent



文章转载自ZILLIZ,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论