arrow
返回

AutoML-Pipeline: A RAG-Enhanced Code Generation Framework With Pre-Validation for Cloud-Native Machine Learning Workflows

delete2026-01-01
delete2
PRE
AI
Z
Zhao, Wenyu *
C
Chen, Tingjie
Y
Yang, Jie Si
Q
Qiu, Lei
DOI:10.1109/ACCESS.2026.3673923delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
云原生机器学习平台的普及显著加速了模型开发和部署周期。然而,构建和维护跨越多种语言(Python、YAML、Spark SQL)和云特定配置的异构管道代码仍然劳动密集且容易出错。现有的基于LLM的代码生成工具缺乏对运行时约束和历史执行模式的感知,经常生成因资源配置不当或依赖冲突而在部署时失败的代码。为解决这些挑战,我们提出AutoML-Pipeline,一个集成了检索增强生成(RAG)与强化学习反馈机制的闭环代码生成框架。我们的方法利用从成功管道执行日志构建的知识库来指导GPT-4生成符合平台特定约束的部署就绪代码。关键创新在于一个新颖的预验证代理,它通过模拟执行环境预测资源消耗并在实际部署前检测依赖冲突。该代理通过由预测执行配置文件和依赖图驱动的反馈循环迭代优化生成的代码。我们在添加了Azure ML管道规范的CodeSearchNet数据集上评估了我们的框架,结果表明与原始GPT-4基线相比,首次提交成功率提高了43.7%,资源过度配置减少了31.2%。消融研究证实,RAG检索机制和预验证代理均对性能提升做出了显著贡献。我们的工作建立了一种将大型语言模型与领域特定运行时智能集成的实用范式,其潜在应用可扩展至其他基础设施即代码生成任务。
Keyword:
Codes
Pipelines
Retrieval augmented generation
Machine learning
Large language models
Knowledge based systems
Training
Reinforcement learning
Programming
Iterative methods
Code generation
retrieval-augmented generation
cloud computing
automated optimization
large language models

期刊

IEEE Access 封面图
IEEE Access
IF:
3.6
论文数:
9.8W
被引数:
29.4W

机构

I
intel china
学者数:
38
论文数: 32
被引数: 0
U
University of Utah
学者数:
3.0W
论文数: 2.2W
被引数: 4.6W
U
Utah System of Higher Education
学者数:
4.6W
论文数: 4.0W
被引数: 161
I
Intel Corporation
学者数:
2.7K
论文数: 2.0K
被引数: 6
学者 查看更多机构
引用论文

引用论文

Taxonomy of real faults in deep learning systems
err2020-10-01
err0
errOAAI
errNargiz Humbatova; Gunel Jahangirova; Gabriele Bavota; Vincenzo Riccio; Andrea Stocco; Paolo Tonella
err分享
err收藏
HELIX
err2018-12-01
err0
PREAI
errDoris Xin; Stephen Macke; Litian Ma; Jialin Liu; Shuchen Song; Aditya Parameswaran
err分享
err收藏
Competition-level code generation with AlphaCode使用字母码生成竞争级代码
err2022-12-09
err0
errOAAI
errYujia Li; David Choi; Junyoung Chung; Nate Kushman; Julian Schrittwieser; Rémi Leblond; Tom Eccles; James Keeling; Felix Gimeno; Agustin Dal Lago; Thomas Hubert; Peter Choy; Cyprien de Masson d’Autume; Igor Babuschkin; Xinyun Chen; Po-Sen Huang; Johannes Welbl; Sven Gowal; Alexey Cherepanov; James Molloy; Daniel J. Mankowitz; Esme Sutherland Robson; Pushmeet Kohli; Nando de Freitas; Koray Kavukcuoglu; Oriol Vinyals
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
An Empirical Study on Deployment Faults of Deep Learning Based Mobile Applications
err2021-05-01
err0
errOAAI
errZhenpeng Chen; Huihan Yao; Yiling Lou; Yanbin Cao; Yuanqiang Liu; Haoyu Wang; Xuanzhe Liu
err分享
err收藏
Nearest neighbor classifiers over incomplete information
err2021-12-09
err0
errOAAI
errBojan Karlaš; Peng Li; Renzhi Wu; Nezihe Merve Gürel; Xu Chu; Wentao Wu; Ce Zhang
err分享
err收藏
Automating large-scale data quality verification
err2018-08-01
err0
PREAI
errSebastian Schelter; Dustin Lange; Philipp Schmidt; Meltem Celikel; Felix Biessmann; Andreas Grafberger
err分享
err收藏
err分享
err收藏
AutoPandas: neural-backed generators for program synthesis
err2019-10-10
err0
errOAAI
errRohan Bavishi; Caroline Lemieux; Roy Fox; Koushik Sen; Ion Stoica
err分享
err收藏
学者 查看更多内容