返回
Optimizing Data Pipelines for Machine Learning in Feature Stores
DOI:10.14778/3625054.3625060.png)
摘要
En 中文
数据流水线(即转换原始数据为特征)对机器学习(ML)模型至关重要,但其开发和管理工作耗时。特征存储最近作为一种新的“面向ML的DBMS”出现,其前提是使数据科学家和工程师能够定义和管理他们的数据流水线。尽管当前的特征存储在功能方面实现了其承诺,但它们资源消耗巨大——在实施数据库式优化以提升性能方面存在大量机会。在本文中,我们提出了一套针对特定时间点连接(point-in-time join)这一数据流水线中关键操作的新型优化方法。我们在广泛使用的特征存储Feathr上实现了这些优化,并在TPCx-AI基准测试和实际在线零售场景中的用例上进行了评估。我们全面的实验分析表明,我们的优化方法可将数据流水线的速度提升至当前最佳基线的3倍。
期刊
暂无期刊信息
机构
暂无机构信息
引用论文
暂无论文信息

