arrow
返回

Enhancing Differential Testing with LLMs for Testing Deep Learning Libraries

delete2026-04-01
delete1
PRE
AI
M
Meiziniu Li
D
D. Li
J
J. Liu
J
Jialun Cao
Y
Yongqiang Tian
S
Shing-Chi Cheung *
DOI:10.1145/3735637delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
差异测试通过比较不同实现之间的测试结果,为缓解测试预言机问题提供了一种有前景的策略。然而,现有针对深度学习(DL)库的差异测试技术受限于两个关键挑战:为给定API寻找替代实现(称为对应实现),以及随后生成多样化的测试输入。为解决这两大挑战,本文引入了DLLENs,一种基于大型语言模型(LLM)增强的差异测试技术,用于DL库。第一个挑战通过观察DL库通常被设计为支持一组相似的DL算法的计算来解决。因此,给定API的计算对应实现可以通过其他DL库中API的特定组合和适配来成功合成。DLLENs引入了一种新颖的对应实现合成工作流程,利用LLM来搜索差异测试的有效对应实现。为解决第二个挑战,DLLENs引入了一种静态分析技术,从给定API及其对应实现的实现中提取路径约束,以指导多样化测试输入的生成。提取过程借助LLM对相关DL库及其上游库的知识。DLLENs引入了验证机制来管理对应实现合成和路径约束提取中LLM的幻觉。我们在两个流行的DL库TensorFlow和PyTorch上评估了DLLENs。评估结果表明,DLLENs为这些库合成了1.84倍于当前最先进技术发现的API对应实现。此外,在相同时间预算下,DLLENs覆盖了7.23%更多的分支,并检测到当前最先进技术1.88倍数量的缺陷,在200个随机采样的API上。DLLENs已成功检测到最近TensorFlow和PyTorch库中的71个缺陷,其中59个得到开发者确认,包括46个确认的先前未知缺陷,这些先前未知缺陷中的10个已在TensorFlow和PyTorch的最新版本中得到修复。
Keyword:
Large Language Model
Differential Testing
Static Analysis
Deep Learning Library Testing

期刊

A
ACM Transactions on Software Engineering and Methodology
IF:
6.2
论文数:
1.2K
被引数:
3.4K

机构

M
monash university
学者数:
9.0K
论文数: 4.0K
被引数: 0
H
hong kong university of science & technology
学者数:
586
论文数: 323
被引数: 0