返回
Collective reflection-based multi-agent reinforcement learning framework for task-oriented dialogue policy learning
DOI:10.1016/j.neunet.2026.109110.png)
摘要
En 中文
多智能体强化学习协同建模对话策略,旨在为准确完成任务选择对话动作。现有多智能体对话策略学习方法通过信用分配解决合作关系以最大化奖励或效用。然而,这些方法存在错误传播风险和缺乏自适应协作能力,从而阻碍了对话策略的性能。主要挑战涉及合理分配每个智能体的信用以及维持它们之间的平衡合作关系。在本文中,我们提出了一种集中式多智能体对话策略学习(MAPL)方法,该方法逐步增强智能体的信用分配,使中心智能体能够确定协作优先级。具体而言,我们的方法构建多个辅助智能体和一个主智能体。辅助智能体与环境交互,更新其Q值并在对话场景中用户意图层面分配信用。主智能体通过分配来自辅助智能体的用户意图信用来更新行为策略。为了平衡辅助智能体的用户意图可信度与主智能体的行为策略,我们提出一个平衡参数,该参数能够自动识别何时优先考虑意图、何时优先考虑策略,并得到理论分析支持。所提出的MAPL易于实现,并整合了各种强化学习方法。在三个数据集上进行实验,我们得出结论:MAPL实现了更高效的策略学习能力及更高的对话成功率,验证了其高效执行特定任务的能力。消融研究证实了智能体数量和智能体组合方式提升了对话策略学习的性能。
Keyword:
Deep reinforcement learning
Dialogue policy learning
Multi-agent reinforcement learning
Human-machine dialogue system
期刊
IF:
6.3
论文数:
8.2K
被引数:
3.0W
机构
引用论文
暂无论文信息

