返回
RAG Embeddings Storage Optimization Through Quantization and Dimensionality Reduction
DOI:10.1007/978-3-032-08465-1_16.png)
摘要
En 中文
检索增强生成是一种强大的框架,它通过从大型外部知识库中检索相关信息来增强语言模型,高度依赖高维向量嵌入。然而,大规模存储这些嵌入面临重大挑战,因其巨大的内存需求。为解决此问题,我们研究了两种互补策略:使用低比特浮点格式的嵌入量化以及通过主成分分析(PCA)进行的降维。我们的实验以nDCG@10(MTEB检索基准中用于排名质量的标准指标)相对于float32基线的性能进行衡量,结果显示,float8等低比特格式可实现4倍存储压缩,性能损失极小(<0.3%),在同等级压缩下显著优于int8。值得注意的是,将float8与适度PCA(例如保留50%维度)相结合可实现更优的权衡,实现8倍总压缩,性能下降小于单独使用int8(例如nomic-embed-text-v1.5下降0.62% vs 1.53%),同时仅需一半的存储空间。这些发现强调了结合float8量化和降维对于高效RAG嵌入存储的有效性,且对检索质量影响极小。
Keyword:
Artificial Intelligence
Machine Learning
Retrieval-Augmented Generation
Quantization
Dimensionality Reduction
Storage Optimization
期刊
H
IF:
0
论文数:
25
被引数:
0

