标签: TurboQuant

0

1000万向量约4GB?TurboQuant正在重写企业RAG的内存成本

turbovec基于Google Research的TurboQuant思路,把“1000万文档向量约4GB”带入企业RAG讨论。其当前README的顶层口径是31GB的FP32语料压至4GB,约减少87%;“约92%”来自其他摘要或特定基线,不能与这一数字混用。真正值得关注的是data-oblivious量化能否在无需训练码本的前提下,重平衡召回率、延迟、内存与运维复杂度。