返回
Efficient multi-agent policy learning using knowledge distillation of large language models
DOI:10.1016/j.neucom.2026.133642.png)
摘要
En 中文
• 提出了一种强化知识蒸馏(RKD)模块,用于转移大型语言模型(LLM)的专业知识和加速策略学习。
• 提出了一种价值修正(VM)模块,用于减少价值高估对智能体策略学习的影响。
• 我们将RKD和VM结合到一个通用的多智能体强化学习(MARL)框架中,该框架提高了现有算法的策略学习速度。
• EMAP-LLM在多种任务难度和环境条件下,在学习速度和鲁棒性方面显著优于基线方法。
Keyword:
reinforcement learning
knowledge distillation
large language models
multi-agent systems
policy learning
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W
机构
引用论文
RLingua: Improving Reinforcement Learning Sample Efficiency in Robotic Manipulations With Large Language ModelsRLingua:利用大型语言模型提高机器人操作中的强化学习样本效率
Clustering experience replay for the effective exploitation in reinforcement learning
PATTERN RECOGNITION
IF7.6
没有更多内容

