返回
Relation Prototype Re-Scoring for CLIP-Based Logical Anomaly Detection and Localization
DOI:10.3390/electronics15184293.png)
摘要
En 中文
基于CLIP的异常检测器已显著推进了免训练和零样本工业异常检测与定位,但其预测仍受限于块级视觉-语言相似性或异常感知特征评分。这种表述在逻辑异常方面存在固有局限,因为每个可见部分可能局部正常,但其数量、位置、排列或共现关系却违反了正常配置。我们引入一个免训练的关系原型重评分模块,该模块复用视觉转换器已编码的语义-空间关系。由于块标记包含位置嵌入,自注意力图既是位置感知的,也是内容依赖的;我们将其用作针对检测器特定块特征的消息传递算子。正常图像定义了类别级、空间索引的关系原型,每个测试块的评分基于其注意力聚合特征与对应正常原型的欧氏偏差。由此生成的映射支持密集定位和基于映射的图像检测。尽管我们也报告了仅特征-关系映射以分析其内在行为,但最终方法将该映射与原始异常映射融合,从而在不丢弃基线检测器局部外观线索的情况下添加关系敏感的证据。我们在AnomalyCLIP上开发该方法,并在WinCLIP和AA-CLIP上验证其通用性。在MVTec LOCO AD的逻辑分割中,所提融合方法将AnomalyCLIP的像素AUROC从53.9提升至74.4,像素AUPRO从28.7提升至52.7,图像AUROC从50.5提升至71.7,而WinCLIP和AA-CLIP也观察到类似改进。在CAD-SD上,所提融合方法在共现异常方面将AnomalyCLIP和WinCLIP的图像AUROC分别提升至92.0和93.8。在MVTec LOCO AD的结构分割和MVTec AD基准上的实验表明为何必须保留基线映射:融合比仅关系评分保留了更多局部缺陷证据,尽管其收益仍取决于检测器和类别。这些结果识别出语义-空间关系偏差是CLIP基于的逻辑异常检测与定位中缺失的线索,且无需显式组件模型、符号规则、额外训练或修改基线架构。
Keyword:
logical anomaly detection
anomaly localization
CLIP
self-attention
semantic–spatial relation
relation prototype
industrial inspection
zero-shot anomaly detection
期刊
IF:
2.6
论文数:
1.0W
被引数:
4.7W
机构
暂无机构信息
引用论文
Gu, Z., Zhu, B., Zhu, G., Chen, Y., Li, H., Tang, M., & Wang, J. (2024, October). Filo: Zero-shot anomaly detection by fine-grained description and high-quality localization. In Proceedings of the 32nd ACM International Conference on Multimedia (pp. 2041-2049).Gu, Z., Zhu, B., Zhu, G., Chen, Y., Li, H., Tang, M., & Wang, J. (2024, 10月). Filo: 基于精细描述和高精度定位的零样本异常检测. 在第32届ACM国际多媒体会议论文集(第2041-2049页).
The MVTec Anomaly Detection Dataset: A Comprehensive Real-World Dataset for Unsupervised Anomaly DetectionMVTec异常检测数据集: 用于无监督异常检测的全面真实数据集
Component-aware anomaly detection framework for adjustable and logical industrial visual inspection用于可调和逻辑工业视觉检查的组件感知异常检测框架
SA-PatchCore: Anomaly Detection in Dataset With Co-Occurrence Relationships Using Self-Attention
IEEE ACCESS
IF3.6

