返回
Text-Vision Embedding for Generalized Diffusion Generated Videos Detection
DOI:10.1007/978-981-95-5634-2_9.png)
摘要
En 中文
扩散模型的快速发展和应用导致了扩散生成视频内容的激增,增加了虚假信息传播的风险。因此,开发一个通用且鲁棒的扩散生成视频检测器势在必行。然而,现有的检测方法缺乏通用和鲁棒的表征,无法泛化到由多种扩散模型创建的视频上。本文指出,基于文本-视觉对比学习的成功,文本-视觉嵌入为扩散生成视频检测提供了通用且鲁棒的表征。文本-视觉对比预训练模型的视觉嵌入固有地区分了真实视频和扩散生成视频。基于这一见解,我们提出了一种通用检测框架,利用视觉内容与文本语义之间的对比嵌入来捕获生成痕迹。在多个视频生成模型上的全面评估表明,我们的检测器具有卓越的通用能力。在未见过的扩散视频模型上,其平均准确率达到0.9229。代码可在https://github.com/1129ljc.T2VE获取。
Keyword:
Text-Vision Embedding
Diffusion Generated Videos Detection
期刊
P
IF:
0
论文数:
28
被引数:
0
机构
引用论文
AEROBLADE: Training-Free Detection of Latent Diffusion Images Using Autoencoder Reconstruction ErrorAEROBLADE:基于自编码器重建误差的无训练检测潜在扩散图像

