返回
Exploring Human Perception-Aligned Perceptual Hashing
DOI:10.1109/MCE.2025.3551813.png)
摘要
En 中文
图像的广泛分享给消费设备中控制有害内容的传播带来了挑战,尤其是涉及儿童性虐待材料的内容。感知哈希通过实现视觉内容的紧凑表示,提供了通过黑名单图像进行快速检测的解决方案。然而,由于传统感知哈希方法的局限性,在大量数据中自动检测(近)重复图像具有挑战性。例如,现有方法可能无法检测经过微小修改的图像,特别是空间修改。此外,这些方法通常被设计用于查找源自同一原始图像的图像,因此无法识别来自不同获取来源的视觉相似图像。本研究探讨了使用视觉Transformer(ViTs),特别是对比语言-图像预训练模型,来增强感知哈希,使其更符合人类感知。所提出的ViTHash方法与传统感知哈希方法(如pHash、dHash和PDQHash)进行了比较。定量结果表明,ViTHash在处理空间失真(如旋转和镜像)方面优于传统方法,尽管其对视觉质量失真(如模糊和压缩)的鲁棒性较低。定性分析显示,ViTHash更贴近人类感知,能够识别视觉相似图像,即使它们描绘的是视觉相似内容但源自不同的获取来源。这些发现表明,ViTHash在需要精细图像相似性评估的应用中具有显著潜力,为增强消费电子设备中有害内容的检测和支持执法工作提供了有价值的工具。
Keyword:
Visualization
Consumer electronics
Transformers
Computer vision
Visual perception
Training
Robustness
Media
Law enforcement
Distortion
期刊
IF:
4.1
论文数:
1.3K
被引数:
1.8K

