arrow
Return

Speech Emotion Recognition Using Transfer Learning: A Comparative Study

delete2026-02-19
delete0
PRE
AI
Y
Yunus Korkmaz *
DOI:10.1002/widm.70073delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
Speech emotion recognition (SER) is a critical research area at the intersection of affective computing and audio signal processing. Traditional approaches often require extensive manual feature engineering and large labeled datasets, which can limit performance in real-world applications. Recently, transfer learning with pretrained audio neural networks has gained significant traction for SER, leveraging knowledge from large-scale audio corpora to improve recognition accuracy and generalization. This review presents a comprehensive overview of transfer learning-based SER systems, with a particular focus on pretrained audio models such as YAMNet, VGGish, Wav2Vec2, and so on. Two main paradigms were examined in this study. First, feature embedding extraction, where pretrained models serve as fixed feature encoders. Second, fine-tuning strategies, where model weights are partially or fully updated on emotion-specific corpora. The article categorizes and compares state-of-the-art studies across multiple datasets, including RAVDESS, EmoDB, IEMOCAP, CREMA-D, and so on, while discussing commonly used evaluation metrics such as accuracy, precision, recall, F1 score, and AUC. Comparative tables are presented to highlight methodological trends and performance differences between feature-based and fine-tuned SER systems. This overview aims to guide researchers in selecting appropriate models and strategies for future SER tasks and to identify open challenges and future research directions in transfer learning for emotion recognition from speech signals.
Keywords:
artificial intelligence
deep learning
self supervised learning
speech emotion recognition
transfer learning
transformer

Journal

W
wires data mining and knowledge discovery
IF:
0
Papers:
36
Citations:
0

Organization

D
dicle university
Scholars:
312
Papers: 197
Citations: 0
Cited Papers

Cited Papers

Transfer Learning for Improving Speech Emotion Classification Accuracy
err2018-09-02
err0
errOAAI
errSiddique Latif; Rajib Rana; Shahzad Younis; Junaid Qadir; Julien Epps
errShare
errSave
HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units
err2021-01-01
err1.1K
errOAAI
errHsu, Wei-Ning; Bolte, Benjamin; Tsai, Yao-Hung Hubert; Lakhotia, Kushal; Salakhutdinov, Ruslan; Mohamed, Abdelrahman
errShare
errSave
Speech emotion recognition using machine learning — A systematic review
err2023-11-01
err0
errOAAI
errSamaneh Madanian; Talen Chen; Olayinka Adeleye; John Michael Templeton; Christian Poellabauer; Dave Parry; Sandra L. Schneider
errShare
errSave
Survey of Deep Representation Learning for Speech Emotion Recognition
err2023-04-01
err57
errOAAI
errLatif, Siddique; Rana, Rajib; Khalifa, Sara; Jurdak, Raja; Qadir, Junaid; Schuller, Bjorn
errShare
errSave
MSP-IMPROV: An Acted Corpus of Dyadic Interactions to Study Emotion Perception
err2017-01-01
err234
errOAAI
errBusso, Carlos; Parthasarathy, Srinivas; Burmania, Alec; AbdelWahab, Mohammed; Sadoughi, Najmeh; Provost, Emily Mower
errShare
errSave
err
IF0
err
err0
PREAI
err
errShare
errSave
Opensmile
err2010-10-25
err0
errOAAI
errFlorian Eyben; Martin Wöllmer; Björn Schuller
errShare
errSave
Towards Learning a Universal Non-Semantic Representation of Speech
err2020-10-25
err0
errOAAI
errJoel Shor; Aren Jansen; Ronnie Maor; Oran Lang; Omry Tuval; Félix de Chaumont Quitry; Marco Tagliasacchi; Ira Shavitt; Dotan Emanuel; Yinnon Haviv
errShare
errSave
Survey on speech emotion recognition: Features, classification schemes, and databases
err2011-03-01
err1.3K
PREAI
errEl Ayadi, Moataz; Kamel, Mohamed S.; Karray, Fakhri
errShare
errSave
researcher View more