arrow
返回

Optimizing Data Pipelines for Machine Learning in Feature Stores

delete2023-12-04
delete0
PRE
AI
DOI:10.14778/3625054.3625060delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
数据流水线(即转换原始数据为特征)对机器学习(ML)模型至关重要,但其开发和管理工作耗时。特征存储最近作为一种新的“面向ML的DBMS”出现,其前提是使数据科学家和工程师能够定义和管理他们的数据流水线。尽管当前的特征存储在功能方面实现了其承诺,但它们资源消耗巨大——在实施数据库式优化以提升性能方面存在大量机会。在本文中,我们提出了一套针对特定时间点连接(point-in-time join)这一数据流水线中关键操作的新型优化方法。我们在广泛使用的特征存储Feathr上实现了这些优化,并在TPCx-AI基准测试和实际在线零售场景中的用例上进行了评估。我们全面的实验分析表明,我们的优化方法可将数据流水线的速度提升至当前最佳基线的3倍。

期刊

暂无期刊信息

机构

暂无机构信息
引用论文

引用论文

暂无论文信息