arrow
返回

Efficient and scalable huge embedding model training via distributed cache management

delete2025-03-05
delete0
PRE
AI
X
Xupeng Miao
张海林 封面图
张海林 (Hailin Zhang)
Y
Yining Shi
X
Xiaonan Nie
杨
杨志 (Zhi Yang)
Y
Yangyu Tao
J
Jie Jiang
崔斌 封面图
崔斌 (Bin Cui) *
DOI:10.1007/s00778-025-00908-wdelete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
嵌入模型已被证明是处理高维数据的有效学习范式。然而,嵌入模型存在一个开放性问题,即其表示(潜在因子)通常导致巨大的参数空间。我们观察到,现有的分布式训练框架在嵌入模型的可扩展性方面面临挑战,因为从服务器更新和检索共享嵌入参数通常主导了训练周期。在本文中,我们提出了HET,一个新型系统框架,显著提升了巨大嵌入模型训练的可扩展性。我们利用嵌入的不均衡流行度分布作为性能机会,并借助嵌入缓存来解决通信瓶颈问题。为确保缓存之间的一致性,我们在HET设计中引入了一种新的 consistency model,该模型能够提供细粒度的一致性保证,针对每个嵌入进行单独处理。与仅允许读操作存在延迟的先前工作不同,HET还利用延迟来优化写操作。在六个代表性任务上的评估表明,HET实现了高达88%的嵌入通信减少,以及高达20.68×的性能加速,超越了当前最先进的基线方法。
Keyword:
Embedding
Cache
High-dimensional data
Efficiency
Communication
Consistency
Scalability
Distributed training system

期刊

VLDB Journal 封面图
VLDB Journal
IF:
3.8
论文数:
81
被引数:
2.4K

机构

T
Tencent Inc
学者数:
27
论文数: 11
被引数: 2
引用论文

引用论文

PICASSO: Unleashing the Potential of GPU-centric Training for Wide-and-deep Recommender Systems
err2022-05-01
err0
errOAAI
errYuanxing Zhang; Langshi Chen; Siran Yang; Man Yuan; Huimin Yi; Jie Zhang; Jiamang Wang; Jianbo Dong; Yunlong Xu; Yue Song; Yong Li; Di Zhang; Wei Lin; Lin Qu; Bo Zheng
err分享
err收藏
FIFO queues are all you need for cache eviction
err2023-10-23
err0
errOAAI
errJuncheng Yang; Yazhuo Zhang; Ziyue Qiu; Yao Yue; Rashmi Vinayak
err分享
err收藏
HET
err2022-02-04
err0
errOAAI
errXupeng Miao; Hailin Zhang; Yining Shi; Xiaonan Nie; Zhi Yang; Yangyu Tao; Bin Cui
err分享
err收藏
Fleche
err2022-03-28
err0
errOAAI
errMinhui Xie; Youyou Lu; Jiazhen Lin; Qing Wang; Jian Gao; Kai Ren; Jiwu Shu
err分享
err收藏
学者 查看更多内容