返回
Empathetic Response Generation Through Multi-Modality
DOI:10.1109/TAFFC.2025.3599869.png)
摘要
En 中文
尽管在共情响应生成(ERG)领域取得了显著进展,现有研究主要集中于通过感知用户情绪和从知识库中推断上下文信息来实现情感共情和认知共情。人类沟通结合了文本、视觉和音频线索来解读他人的意图。然而,以往的ERG工作侧重于基于文本的方法,并忽视了音视频数据中的上下文信息。为弥补这一差距,我们提出通过整合音视频和文本模态来培养与用户的共情。首先,所提出的方法使用跨模态注意力机制从多模态对话中感知用户情绪。在响应生成过程中,它将多模态数据与感知到的情绪相结合,从而使生成的响应通过镜像用户情绪在情感层面与用户产生共鸣。其次,我们引入关注视觉上下文或用户经历的指导文本,提供上下文信息,从而增强认知共情。所提出的方法通过多源注意力机制对齐多模态对话历史和指导文本。最后,该方法通过理解用户背景和情绪来生成共情响应。在三个多模态数据集(如MELD、IEMOCAP和MEDIC)上的实验表明,所提出的方法优于当前最优工作。
Keyword:
Affective computing
empathetic dialogue systems
empathetic response generation
empathy
期刊
IF:
9.8
论文数:
1.4K
被引数:
9.1K
机构
引用论文
暂无论文信息

