返回
Sequential memory improves sample and memory efficiency in episodic control
DOI:10.1038/s42256-024-00950-3.png)
摘要
En 中文
深度强化学习算法以其样本低效性而闻名,需要大量回合才能达到最佳性能。回合并发强化学习算法旨在通过使用扩展记忆系统来利用过去经验以克服这一问题。然而,这些记忆增强通常仅用作缓冲区,从中对孤立事件进行离线重采样(例如回放)。在本文中,我们介绍了顺序回合并发控制(SEC),这是一种海马体启发的模型,按时间顺序存储完整的事件序列,并在检索时采用顺序偏差来指导行动。我们在Animal-AI测试平台的多个基准上评估了SEC,证明了其相较于模型无关的回合并发控制、深度Q网络以及具有关联记忆的回合并发强化学习等几种当前最优模型的优越性能和样本效率。我们的实验表明,在需要记忆和决策的任务中,SEC能实现更高的奖励和更快的策略收敛。此外,我们研究了记忆约束和遗忘机制的影响,揭示优先遗忘能同时提升性能和策略稳定性。进一步地,消融研究证明了顺序记忆组件在SEC中的关键作用。最后,我们讨论了快速、顺序性海马体式回合并发记忆系统如何支持人工和生物系统中的习惯形成和审慎思考。
Keyword:
HIPPOCAMPUS
CELLS
OSCILLATIONS
PREFERENCE
MECHANISM
DECISIONS
LEVEL
期刊
IF:
23.9
论文数:
1.3K
被引数:
1.5W
机构
引用论文
Modeling Theory of Mind in Dyadic Games Using Adaptive Feedback Control基于自适应反馈控制的二人游戏中的心理理论建模
Information
IF0
Reinforcement Learning and Episodic Memory in Humans and Animals: An Integrative Framework人类和动物的强化学习和情景记忆: 一个综合框架

