Return
Spatial-temporal self-supervised learning for audio classification
DOI:10.1016/j.eswa.2025.130641.png)
Abstract
En 中文
• Explores multi-level spatial and temporal attention in SSL pretext tasks. • Introduces constrained self-supervised training using cross-domain validation. • Utilises ACAV100M, a recent large-scale unlabeled audio-visual dataset. • Benchmarks downstream performance on emotion and Arabic music classification.
Journal
IF:
7.5
Papers:
3.0W
Citations:
10.2W
Organization
Cited Papers
Deep anomaly detection with self-supervised learning and adversarial training
PATTERN RECOGNITION
IF7.6

