返回
Toward Generalizable Forgery Detection and Reasoning
DOI:10.1109/TIP.2026.3673967.png)
摘要
En 中文
准确且可解释的AI生成图像检测对于缓解与AI滥用相关的风险至关重要。然而,生成模型之间的显著领域差异使得开发通用的伪造检测模型具有挑战性。此外,由于AI生成图像中的每个像素都是合成的,传统的基于显著性的伪造解释方法并不适用于此任务。为解决这些挑战,我们将检测和解释表述为一个统一的“伪造检测与推理任务”(FDR-Task),利用多模态大语言模型(MLLMs)通过在伪造属性上的可靠推理实现准确检测。为促进此任务,我们引入了“多模态伪造推理数据集”(MMFR-Dataset),这是一个包含10种生成模型、12万张图像的大型数据集,并附有37.8万条关于伪造属性的推理标注,以支持FDR-Task的全面评估。此外,我们提出了FakeReasoning框架,该伪造检测与推理框架包含三个关键组件:1)一个集成CLIP和DINO的双分支视觉编码器,用于捕捉高阶语义和低阶伪影;2)一个“伪造感知特征融合模块”,利用DINO的注意力图和交叉注意力机制引导MLLMs关注与伪造相关的线索;3)一个“分类概率映射器”,耦合语言建模与伪造检测,以提升整体性能。跨多个生成模型的实验表明,FakeReasoning不仅实现了稳健的泛化能力,还在检测和推理任务上均超越了当前最优方法。代码可在以下地址获取:https://github.com/PRIS-CV/FakeReasoning
Keyword:
Forgery detection
multi-modal large language model
visual reasoning
attention mechanism
期刊
IF:
13.7
论文数:
1.0W
被引数:
8.4W
机构
引用论文
Do computer vision foundation models learn the low-level characteristics of the human visual system? CVPR ArXiV: 2502.20256计算机视觉基础模型是否学习人类视觉系统的低级特征?CVPR ArXiV: 2502.20256
Lai, Z.; Li, J.; Wang, C.; Wu, J.; Jiang, D. LIDeepDet: Deepfake Detection via Image Decomposition and Advanced Lighting Information Analysis. Electronics 2024, 13, 4466. [Google Scholar] [CrossRef]赖,Z.; 李,J.; 王,C.; 吴,J.; 江D. LIDeepDet:基于图像分解和先进光照信息分析的深度伪造检测。电子学 2024, 13, 4466. [谷歌学术] [ CrossRef ]

