arrow
返回

AutoTestForge: A Multidimensional Automated Testing Framework for Natural Language Processing Models

delete2026-08-21
delete0
PRE
AI
H
Hengrui Xing
田聪 (Cong Tian)
L
Liang Zhao
Z
Zhi Ma
W
Wensheng Wang
N
Nan Zhang
C
Chao Huang
Z
Zhenhua Duan
DOI:10.1145/3783995delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
近年来,行为测试在自然语言处理(NLP)模型评估中的应用经历了显著增长。然而,现有方法受限于依赖人工劳动和能力评估范围的局限性。为解决这些限制,我们介绍了AutoTestForge,一个用于NLP模型的自动化和多维度测试框架。通过集成大型语言模型(LLMs)自动生成测试模板并实例化,显著减少了人工参与。此外,提出了一种基于差异测试的测试用例标签验证机制,利用多模型投票系统来保证测试用例的质量。该框架在三个维度上扩展了测试套件:分类、公平性和鲁棒性,提供了对NLP模型能力的全面评估。这种扩展使得能够对模型进行深入和全面的评估,为其优势和劣势提供有价值的见解。在情感分析(SA)任务和语义文本相似性(STS)任务上的全面评估表明,AutoTestForge在更高的失败率下(SA任务平均为32.35%,STS任务为31.61%)持续优于现有数据集和测试工具。此外,不同的生成策略在失败率从25.77%到38.04%的范围内表现出稳定的效果。
Keyword:
Natural Language Processing,Large Language Model,Behavioral Testing,Bias and Fairness,Model Robustness and Security

期刊

A
ACM Transactions on Software Engineering and Methodology
IF:
6.2
论文数:
1.2K
被引数:
3.4K

机构

暂无机构信息
引用论文

引用论文

暂无论文信息