arrow
返回

Human-inspired framework to accelerate reinforcement learning

delete2025-08-15
delete0
delete
OA
AI
A
Ali Beikmohammadi *
S
Sindri Magnússon
DOI:10.1007/s11227-025-07737-2delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
强化学习(RL)对数据科学决策至关重要,但存在样本低效问题,尤其是在涉及高成本物理交互的现实场景中。本文提出了一种新颖的人本启发式框架,用于提升RL算法的样本效率。该框架通过首先让学习代理接触逐步增加复杂度的简单任务,最终引导至主任务。该方法无需预训练,且仅需一个回合学习简单任务。由此获得的知识可促进多种迁移学习策略,如值函数与策略迁移,且不会增加计算复杂度。该方法可应用于不同目标、环境和RL算法,包括基于值函数、基于策略、表格型及深度RL方法。实验评估证明了该框架在提升样本效率方面的有效性,尤其在具有挑战性的主任务中表现突出,并通过简单随机游走及更复杂的约束最优控制问题进行了验证。
Keyword:
Deep reinforcement learning
Policy optimization
PPO
Sample efficiency
Exploration
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

Journal of Supercomputing 封面图
Journal of Supercomputing
IF:
2.7
论文数:
1.1K
被引数:
1.0W

机构

D
Department of Computer and Systems Sciences
学者数:
17
论文数: 8
被引数: 0
引用论文

引用论文

err分享
err收藏
Information-seeking, curiosity, and attention: computational and neural mechanisms
err2013-11-01
err498
errOAAI
errGottlieb, Jacqueline; Oudeyer, Pierre-Yves; Lopes, Manuel; Baranes, Adrien
err分享
err收藏
Generalized predictive control for a coupled four tank MIMO system using a continuous-discrete time observer
err2017-03-01
err28
PREAI
errGouta, Houssemeddine; Said, Salim Hadj; Barhoumi, Nabil; M'Sahli, Faouzi
err分享
err收藏
err分享
err收藏
Overcoming catastrophic forgetting in neural networks克服神经网络中的灾难性遗忘
err2017-03-14
err3.7K
errOAAI
errKirkpatricka, James; Pascanu, Razvan; Rabinowitz, Neil; Veness, Joel; Desjardins, Guillaume; Rusu, Andrei A.; Milan, Kieran; Quan, John; Ramalho, Tiago; Grabska-Barwinska, Agnieszka; Hassabis, Demis; Clopath, Claudia; Kumaran, Dharshan; Hadsell, Raia
err分享
err收藏
没有更多内容