返回
Optimizing multi-domain task-oriented dialogue policy through Sigmoidal Discrete Soft Actor–Critic
DOI:10.1016/j.csl.2026.102039.png)
摘要
En 中文
• 基于强化学习的面向任务对话策略优化框架。
• 多轮对话系统中的稳定性和鲁棒性提升。
• Soft Actor–Critic (SAC) 在结构化动作空间中的扩展。
• 通过一种新型公式化方法缓解离散 SAC 中的低估偏差。
• 基于 sigmoid 的策略参数化方法以改进探索和决策制定。
Keyword:
Task-oriented dialogue systems
Dialogue policy optimization
Reinforcement learning
Soft actor–critic
Discrete action spaces
Sigmoidal policy
Off-policy learning

