返回
Deception Detection Meets Vision-Language Models
DOI:10.1007/s11263-026-02932-x.png)
摘要
En 中文
预训练的视觉-语言模型如CLIP最近在各种下游任务中表现出卓越性能,包括图像分类和视频理解。然而,在自动化欺骗检测(ADD)等高级视觉任务中,标签与视觉内容之间的语义关联较弱且缺乏明确的文本描述。因此,此类模型在自动化欺骗检测中的应用仍不确定。为解决此问题,本文将预训练的CLIP模型应用于自动化欺骗检测,并提出一种新的ADD-CLIP模型。受心理学发现启发,我们将欺骗行为领域的知识注入CLIP模型。具体而言,ADD-CLIP由视觉部分和文本部分组成。在视觉部分,我们在CLIP的图像编码器中引入两种提示学习策略:时序和微观差异提示学习。这些策略通过可学习的网络层实现,以捕捉面部的时间动态和细微运动特征。在文本部分,我们未使用传统类别标签作为文本模态输入,而是在大型语言模型(如ChatGPT)的帮助下,从面部和面部动作单元(AU)视角构建面部行为差异文本描述作为文本监督。此外,我们在面部级和AU级分别添加对应行为描述的可学习双提示。此设计使模型能够自动学习互补的语义空间,从而形成更准确的决策边界。大量实验结果表明,ADD-CLIP在DOLOS、Bag-of-Lies和MU3D数据集上表现出优异性能,验证了其有效性。代码公开可访问于https://github.com/zdl12345678/Deception-Detection-Meets-Vision-Language-Models 。
Keyword:
Automated Deception Detection
Deep Learning
Visual Language Model
期刊
IF:
9.3
论文数:
3.9K
被引数:
2.8W
机构
引用论文
FusionMamba: dynamic feature enhancement for multimodal image fusion with MambaFusionMamba:基于Mamba的多模态图像融合动态特征增强

