返回
Multi-Scale Self-Supervised Learning for Efficient Audio Deepfake Detection
DOI:10.1109/LSP.2025.3634032.png)
摘要
En 中文
神经声码器能够生成高度逼真的合成语音,对多媒体认证构成挑战;然而,现有的检测方法在应对未见过的合成方法时鲁棒性有限,且部署准备不足。我们提出MASD(多尺度人工痕迹感知自监督深度伪造检测器),结合多尺度SSL与手工特征。MASD将频谱图分解为三个频带,通过使用掩码重建、对比预测编码和对抗声码器分类进行预训练的编码器进行处理。特征通过交叉注意力与相位一致性、频谱通量和高频能量融合,并由温度缩放的SVM进行分类。在ASVspoof 2019 LA上的评估展示了最先进的表现。消融研究证实对抗增强是鲁棒性的主要驱动因素,将EER从1.52%提升至0.39%,而零样本跨数据集评估验证了泛化有效性,确立了MASD为实用解决方案。
Keyword:
Audio deepfake detection
adversarial augmen- tation
confidence calibration
self-supervised learning
期刊
I
IF:
3.9
论文数:
630
被引数:
0

