返回
MSMF-MIL: Multi-Scale Mixed Feature-Based Multiple Instance Learning for Speech Emotion Recognition
DOI:10.1109/TCE.2025.3596056.png)
摘要
En 中文
自然言语中的语音情感本质上复杂且不均匀,关键情感线索通常局限于短暂片段。为应对这一挑战,我们提出了一种基于多尺度混合特征的新型框架,该框架利用了多重实例学习(MIL)。在我们的方法中,每个语音片段被转换为一个包含多个片段的“袋”,每个片段被视为一个独立实例。受MIL识别集合内关键实例的能力启发,我们的框架在帧级和片段级均采用基于CNN的MIL模型,同时采用基于ResNet的模型提取片段级特征。这些多尺度表示随后被融合,以分离并强调表达主导情感的临界语音片段。在交互式情感双工动作捕捉数据库(IEMOCAP)、柏林情感语音数据库(Emo-DB)以及自发的乌尔都语语音情感数据库(URDU)上的实验评估证明了我们方法的有效性,在IEMOCAP上达到67.76%的加权准确率和58.39%的非加权准确率,在Emo-DB上达到93.80%的加权准确率和91.92%的非加权准确率,在URDU上达到95.75%的非加权准确率。这些结果证实,基于MIL的多尺度特征融合策略显著提升了语音情感识别系统的鲁棒性和准确性。
Keyword:
Multiple instance learning
speech emotion recognition
multi-scale mixed feature
期刊
IF:
10.9
论文数:
5.1K
被引数:
6.8K
机构
引用论文
暂无论文信息

