返回
Data Preprocessing Methods for Automating MLOps Pipelines: A Comparative Study
DOI:10.1145/3777490.3777501.png)
摘要
En 中文
数据预处理工具在MLOps流水线中正越来越多地被用于自动模型开发。然而,自动化流程的公平性和可靠性研究不足,可能导致性能下降或引入偏差。本研究通过评估自动化数据预处理方法与基线方法的对比,解决了这一差异,旨在将其集成到TensorFlow Extended (TFX)流水线中。通过分类指标和子组公平性比较各方法的性能以确定潜在偏差,并采用显著性检验将各自动化方法与基线进行比较。结果表明,约一半的自动化方法性能与基线模型相当,其余方法表现明显更差;更重要的是,没有任何自动化方法显著优于基线。这些结果说明,并非所有自动化预处理方法都可以不经人工验证直接使用。
Keyword:
MLOps Pipelines
Data Preprocessing
TensorFlow Extended (TFX)
TensorFlow Data Validation (TFDV)
Fairness in Machine Learning
Outlier Detection and Imputation
期刊
机构
暂无机构信息
引用论文
Anomaly Detection on Interleaved Log Data With Semantic Association Mining on Log-Entity Graph基于日志-实体图语义关联挖掘的交错日志数据异常检测
没有更多内容

