返回
Efficient and scalable huge embedding model training via distributed cache management
DOI:10.1007/s00778-025-00908-w.png)
摘要
En 中文
嵌入模型已被证明是处理高维数据的有效学习范式。然而,嵌入模型存在一个开放性问题,即其表示(潜在因子)通常导致巨大的参数空间。我们观察到,现有的分布式训练框架在嵌入模型的可扩展性方面面临挑战,因为从服务器更新和检索共享嵌入参数通常主导了训练周期。在本文中,我们提出了HET,一个新型系统框架,显著提升了巨大嵌入模型训练的可扩展性。我们利用嵌入的不均衡流行度分布作为性能机会,并借助嵌入缓存来解决通信瓶颈问题。为确保缓存之间的一致性,我们在HET设计中引入了一种新的 consistency model,该模型能够提供细粒度的一致性保证,针对每个嵌入进行单独处理。与仅允许读操作存在延迟的先前工作不同,HET还利用延迟来优化写操作。在六个代表性任务上的评估表明,HET实现了高达88%的嵌入通信减少,以及高达20.68×的性能加速,超越了当前最先进的基线方法。
Keyword:
Embedding
Cache
High-dimensional data
Efficiency
Communication
Consistency
Scalability
Distributed training system
期刊
IF:
3.8
论文数:
81
被引数:
2.4K

