arrow
Return

Multi-Scale Self-Supervised Learning for Efficient Audio Deepfake Detection

delete2025-12-19
delete0
PRE
AI
T
Taiba Majid Wani
I
Irene Amerini
DOI:10.1109/LSP.2025.3634032delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
Neural vocoders enable highly realistic synthetic speech that challenges multimedia authentication; however, existing detection approaches suffer from limited robustness to unseen synthesis methods and inadequate deployment readiness. We propose MASD (Multi-scale Artifact-aware Self-supervised Deepfake detector), combining multi-scale SSL with handcrafted features.MASD decomposes spectrograms into three frequency bands, processed through an encoder pretrained using masked reconstruction, contrastive predictive coding, and adversarial vocoder classification. Features fuse with phase coherence, spectral flux, and high-frequency energy through cross-attention, classified by temperature-scaled SVM. Evaluation on ASVspoof 2019 LA demonstrates state-of-the-art performance. Ablation studies confirm adversarial augmentation as the primary driver of robustness, improving EER from 1.52% to 0.39%, while zero-shot cross-dataset evaluation validates generalization effectiveness, establishing MASD as a practical solution.
Keywords:
Audio deepfake detection
adversarial augmen- tation
confidence calibration
self-supervised learning

Journal

I
IEEE Signal Processing Letters
IF:
3.9
Papers:
784
Citations:
0

Organization

S
Sapienza University of Rome
Scholars:
3.0K
Papers: 1.2K
Citations: 4.5W
Cited Papers

Cited Papers

errShare
errSave
ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech
err2020-11-01
err0
errOAAI
errXin Wang; Junichi Yamagishi; Massimiliano Todisco; Héctor Delgado; Andreas Nautsch; Nicholas Evans; Md Sahidullah; Ville Vestman; Tomi Kinnunen; Kong Aik Lee; Lauri Juvela; Paavo Alku; Yu-Huai Peng; Hsin-Te Hwang; Yu Tsao; Hsin-Min Wang; Sébastien Le Maguer; Markus Becker; Fergus Henderson; Rob Clark; Yu Zhang; Quan Wang; Ye Jia; Kai Onuma; Koji Mushika; Takashi Kaneda; Yuan Jiang; Li-Juan Liu; Yi-Chiao Wu; Wen-Chin Huang; Tomoki Toda; Kou Tanaka; Hirokazu Kameoka; Ingmar Steiner; Driss Matrouf; Jean-François Bonastre; Avashna Govender; Srikanth Ronanki; Jing-Xuan Zhang; Zhen-Hua Ling
errShare
errSave
ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild
err2023-01-01
err42
errOAAI
errLiu, Xuechen; Wang, Xin; Sahidullah, Md; Patino, Jose; Delgado, Hector; Kinnunen, Tomi; Todisco, Massimiliano; Yamagishi, Junichi; Evans, Nicholas; Nautsch, Andreas; Lee, Kong Aik
errShare
errSave
End-to-End anti-spoofing with RawNet2
err2021-06-06
err0
errOAAI
errHemlata Tak; Jose Patino; Massimiliano Todisco; Andreas Nautsch; Nicholas Evans; Anthony Larcher
errShare
errSave
AASIST: Audio Anti-Spoofing Using Integrated Spectro-Temporal Graph Attention Networks
err2022-05-23
err0
errOAAI
errJee-weon Jung; Hee-Soo Heo; Hemlata Tak; Hye-jin Shim; Joon Son Chung; Bong-Jin Lee; Ha-Jin Yu; Nicholas Evans
errShare
errSave
Audio-deepfake detection: Adversarial attacks and countermeasures
err2024-09-01
err0
errOAAI
errRabhi, Mouna; Bakiras, Spiridon; Di Pietro, Roberto
errShare
errSave
ASVspoof 2021: accelerating progress in spoofed and deepfake speech detection
err2021-09-16
err0
errOAAI
errJunichi Yamagishi; Xin Wang; Massimiliano Todisco; Md Sahidullah; Jose Patino; Andreas Nautsch; Xuechen Liu; Kong Aik Lee; Tomi Kinnunen; Nicholas Evans; Héctor Delgado
errShare
errSave
researcher View more