arrow
返回

Efficient multi-agent policy learning using knowledge distillation of large language models

delete2026-04-14
delete0
PRE
AI
L
Liqiang Tian
P
Peiliang Wu *
Q
Qian Zhang
B
Bingyi Mao
W
Wenbai Chen
DOI:10.1016/j.neucom.2026.133642delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• 提出了一种强化知识蒸馏(RKD)模块,用于转移大型语言模型(LLM)的专业知识和加速策略学习。 • 提出了一种价值修正(VM)模块,用于减少价值高估对智能体策略学习的影响。 • 我们将RKD和VM结合到一个通用的多智能体强化学习(MARL)框架中,该框架提高了现有算法的策略学习速度。 • EMAP-LLM在多种任务难度和环境条件下,在学习速度和鲁棒性方面显著优于基线方法。
Keyword:
reinforcement learning
knowledge distillation
large language models
multi-agent systems
policy learning

期刊

Neurocomputing 封面图
Neurocomputing
IF:
6.5
论文数:
2.5W
被引数:
6.5W

机构

B
Beijing Information Science and Technology University
学者数:
628
论文数: 315
被引数: 1.5K
Y
yanshan university
学者数:
4.6K
论文数: 1.4K
被引数: 0
N
nankai university
学者数:
4.8W
论文数: 3.3W
被引数: 74
学者 查看更多机构
引用论文

引用论文

Bi-DexHands: Towards Human-Level Bimanual Dexterous Manipulation
err2024-05-01
err0
PREAI
errYuanpei Chen; Yiran Geng; Fangwei Zhong; Jiaming Ji; Jiechuang Jiang; Zongqing Lu; Hao Dong; Yaodong Yang
err分享
err收藏
Multi-objective crowd-aware robot navigation system using deep reinforcement learning
err2024-01-01
err5
PREAI
errCheng, Chien-Lun; Hsu, Chen-Chien; Saeedvand, Saeed; Jo, Jun-Hyung
err分享
err收藏
Limited Information Aggregation for Collaborative Driving in Multi-Agent Autonomous Vehicles
err
IF0
err2024-07-01
err0
PREAI
errQingyi Liang; Jia Liu; Zhengmin Jiang; Jianwen Yin; Kun Xu; Huiyun Li
err分享
err收藏
ChatGPT for Robotics: Design Principles and Model Abilities机器人技术的ChatGPT: 设计原则和模型能力
err2024-01-01
err53
errOAAI
errVemprala, Sai H.; Bonatti, Rogerio; Bucker, Arthur; Kapoor, Ashish
err分享
err收藏
err分享
err收藏
UNMAS: Multiagent Reinforcement Learning for Unshaped Cooperative Scenarios
err2023-04-01
err30
errOAAI
errChai, Jiajun; Li, Weifan; Zhu, Yuanheng; Zhao, Dongbin; Ma, Zhe; Sun, Kewu; Ding, Jishiyu
err分享
err收藏
False Correlation Reduction for Offline Reinforcement Learning
err2024-02-01
err0
errOAAI
errZhihong Deng; Zuyue Fu; Lingxiao Wang; Zhuoran Yang; Chenjia Bai; Tianyi Zhou; Zhaoran Wang; Jing Jiang
err分享
err收藏
没有更多内容