返回
Appareo: Runtime Reliability Inspection for Deep Learning-Based Image Recognition Systems
DOI:10.1109/tase.2026.3730789.png)
摘要
En 中文
当前最先进(SOTA)的深度学习(DL)模型可能在不提示不确定性的情况下产生错误的推理结果,限制了其在安全性和质量关键型自动化系统中的可靠性。从软件测试的角度来看,由于缺乏有效的测试基准和现有方法的可扩展性有限,现代卷积神经网络和基于Transformer的图像识别模型的运行时推理可靠性评估仍然具有挑战性。本文提出了Appareo,一种用于基于DL的图像识别系统的无监督运行时可靠性评估框架。受变形测试(MT)原理启发,Appareo构建语义保留的变换输入,并评估原始样本和变换样本之间的推理一致性。为了增强运行时测试基准,Appareo进一步通过比较从基于热图的视觉解释技术中提取的关键识别区域的解释一致性验证。预测一致性或解释一致性的违反被视为不可靠推理行为的指标。我们在ImageNet和Caltech数据集上使用基于卷积神经网络的模型和基于Transformer的模型,对大规模图像识别任务进行了广泛的评估。实验结果表明,Appareo在非预期异常样本检测方面实现了0.77的F1分数,并在多样化的对抗攻击下以0.80的平均AUC优于几个SOTA对抗检测器。此外,我们在对抗扰动和环境不确定性的情况下,在一个真实世界的自动化视觉检测场景中评估了Appareo。结果表明,Appareo是现代基于DL的图像识别系统的一个有效且可扩展的运行时可靠性评估框架。实践者注意—基于DL的图像识别模型在智能制造和自动化检测系统中广泛应用,但它们可能在环境扰动或对抗扰动下产生不可靠的预测。本工作提出了一种无监督的运行时可靠性评估框架,该框架通过语义保留的输入变换验证推理一致性。该框架联合分析预测一致性和解释一致性,以识别潜在的不可靠推理行为,而无需标记的部署数据或对现有模型的修改。在大型图像分类任务和真实世界的自动化视觉检测场景中的实验结果表明,所提出的方法能够有效检测非预期异常样本和对抗扰动,同时保持实用的运行时开销。该框架在推理结果传播到下游控制模块之前提供补充的可靠性信号,支持智能工业自动化和机器人感知系统。
Keyword:
Modeling
Runtime
Signal detection
Inspection
Image recognition
Visualization
Conferences
Forests
Labeling
Testing
Soft testing
reliability assessment
metamorphic testing
image recognition
adversarial detection
期刊
IF:
6.4
论文数:
5.1K
被引数:
1.6W
机构
引用论文
暂无论文信息

