返回
Speech Emotion Recognition Using Transfer Learning: A Comparative Study
DOI:10.1002/widm.70073.png)
摘要
En 中文
语音情感识别(SER)是情感计算与音频信号处理交叉领域的一个关键研究方向。传统方法通常需要大量的手动特征工程和大规模标注数据集,这可能限制其在实际应用中的性能。近年来,利用预训练音频神经网络的迁移学习在SER领域获得了显著进展,通过利用大规模音频语料库的知识来提高识别精度和泛化能力。本文对基于迁移学习的SER系统进行了全面概述,特别关注预训练音频模型,如YAMNet、VGGish、Wav2Vec2等。本研究考察了两种主要范式:首先,特征嵌入提取,其中预训练模型作为固定的特征编码器;其次,微调策略,其中模型权重在情感特定语料库上进行部分或完全更新。文章对包括RAVDESS、EmoDB、IEMOCAP、CREMA-D等在内的多个数据集上的最新研究进行了分类和比较,同时讨论了常用的评估指标,如准确率、精确率、召回率、F1分数和AUC。通过比较表格突出了基于特征和微调的SER方法在方法论趋势和性能差异上的对比。本文旨在为研究人员选择未来SER任务中的适当模型和策略提供指导,并识别情感识别迁移学习领域中的开放性挑战和未来研究方向。
Keyword:
artificial intelligence
deep learning
self supervised learning
speech emotion recognition
transfer learning
transformer
期刊
W
IF:
0
论文数:
36
被引数:
0
机构
引用论文
HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units休伯特: 通过隐藏单元的掩蔽预测进行自我监督的语音表示学习

