返回
MPRNet: A Temporal-Aware Cross-Modal Encoding Framework for Personality Recognition
DOI:10.1109/TAFFC.2025.3601134.png)
摘要
En 中文
近期在人格识别方面的进展提升了从多模态数据中进行特质推断的能力,但许多现有方法依赖短时视频片段或静态图像,由于视频时长短、帧级标注稀疏以及音频、文本和视觉通道间模态覆盖不一致,限制了时序动态的建模。这些局限性使得难以在自然场景中建模人格特质随时间和模态的变化表现。为解决这些挑战,我们介绍了东北大学人格识别(NEUPR)数据集,该数据集包含通过MBTI评估收集的654个自报告和基于讨论的视频。NEUPR提供了自然表达的多模态数据,包括音频、面部表情、眼动和语音转录,这些数据采集自多样化参与者和真实世界场景。基于此数据集,我们提出了MPRNet,一个用于动态人格识别的统一框架,其核心创新包括:(1)一个多模态编码器,利用LSTM捕捉更长序列的时序依赖,并整合从文本BERT表示中提取的潜在人格嵌入以丰富语义上下文,通过自适应权重融合并由Gram编码增强以保留局部特征模式;(2)一个特征增强模块,引入可学习的位置编码和通道注意力以解决模态不平衡并提升对跨模态空间显著特征的敏感性。实验结果表明,MPRNet在多个数据集上优于当前最优方法,而消融研究证实了其组件的有效性。通过显式建模时序变化并增强跨模态融合,MPRNet实现了更稳健的人格推断。本研究既建立了基准数据集,也为多模态人格分析提供了自适应建模框架,推动了动态特质识别的发展。
Keyword:
Personality recognition
multimodal data encoding
Myers-Briggs type indicator
classification
期刊
IF:
9.8
论文数:
1.3K
被引数:
9.1K
机构
引用论文
暂无论文信息

