arrow
返回

RAG Embeddings Storage Optimization Through Quantization and Dimensionality Reduction

delete2026-01-01
delete0
PRE
AI
N
Naamán Huerga-Pérez
R
Rubén Álvarez
Á
Álvaro Sánchez-Fernández
J
Javier Díez-González *
DOI:10.1007/978-3-032-08465-1_16delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
检索增强生成是一种强大的框架,它通过从大型外部知识库中检索相关信息来增强语言模型,高度依赖高维向量嵌入。然而,大规模存储这些嵌入面临重大挑战,因其巨大的内存需求。为解决此问题,我们研究了两种互补策略:使用低比特浮点格式的嵌入量化以及通过主成分分析(PCA)进行的降维。我们的实验以nDCG@10(MTEB检索基准中用于排名质量的标准指标)相对于float32基线的性能进行衡量,结果显示,float8等低比特格式可实现4倍存储压缩,性能损失极小(<0.3%),在同等级压缩下显著优于int8。值得注意的是,将float8与适度PCA(例如保留50%维度)相结合可实现更优的权衡,实现8倍总压缩,性能下降小于单独使用int8(例如nomic-embed-text-v1.5下降0.62% vs 1.53%),同时仅需一半的存储空间。这些发现强调了结合float8量化和降维对于高效RAG嵌入存储的有效性,且对检索质量影响极小。
Keyword:
Artificial Intelligence
Machine Learning
Retrieval-Augmented Generation
Quantization
Dimensionality Reduction
Storage Optimization

期刊

H
HYBRID ARTIFICIAL INTELLIGENT SYSTEMS, HAIS 2025, PT I
IF:
0
论文数:
25
被引数:
0

机构

U
universidad de leon
学者数:
4.9K
论文数: 3.8K
被引数: 3
引用论文

引用论文

Word2Vec
err2016-12-16
err0
errOAAI
errKENNETH WARD CHURCH
err分享
err收藏
err分享
err收藏
Lightweight Deep Learning: An Overview
err2024-07-01
err53
PREAI
errWang, Ching-Hao; Huang, Kang-Yang; Yao, Yi; Chen, Jun-Cheng; Shuai, Hong-Han; Cheng, Wen-Huang
err分享
err收藏
err分享
err收藏
err2019-01-01
err0
PREAI
errJacob Devlin; Ming-Wei Chang; Kenton Lee; Kristina Toutanova
err分享
err收藏
没有更多内容