返回
Efficient Multitask Reinforcement Learning via Task-Specific Action Correction
DOI:10.1109/TCDS.2025.3543694.png)
摘要
En 中文
多任务强化学习(MTRL)在构建通用智能体方面具有潜力,能够使其在不同任务间实现泛化。然而,MTRL可能仍易受任务间冲突的影响。造成这一问题的首要原因是通用策略难以在多任务中平衡短期和密集的学习信号,例如强化学习中的不同奖励函数。在社会认知理论中,内化的未来目标作为一种认知表征形式,能够有效缓解多任务设置中的潜在短期冲突。考虑到未来目标的优势,我们从目标视角出发,提出了一种新颖且通用的框架——任务特定动作校正(TSAC),作为对先前MTRL方法的一种正交研究。具体而言,为避免短视问题,TSAC引入了目标导向的稀疏奖励,并将策略学习分解为两个独立策略:共享策略(SP)和动作校正策略(ACP)。SP基于引导性的密集奖励输出短期视角的动作。为缓解SP因过度关注特定任务细节而导致的冲突,ACP整合了目标导向的稀疏奖励,使智能体能够采取长期视角输出校正动作,并实现跨任务泛化。最后,SP和ACP输出的动作通过动作校正函数结合,形成与环境交互的最终动作。在Meta-World和StarCraft II多智能体多任务场景中的大量实验表明,TSAC优于现有的最先进方法,在样本效率、泛化能力和有效动作执行方面均取得了显著提升。
Keyword:
Future goals
generalization
Lagrangian method
multitask reinforcement learning
期刊
IF:
4.9
论文数:
1.0K
被引数:
3.5K
机构
引用论文
暂无论文信息

