arrow
返回

Sequential memory improves sample and memory efficiency in episodic control

delete2024-12-31
delete1
delete
OA
AI
I
Ismael T. Freire *
A
Adrián F. Amil *
P
Paul F. M. J. Verschure *
DOI:10.1038/s42256-024-00950-3delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
深度强化学习算法以其样本低效性而闻名,需要大量回合才能达到最佳性能。回合并发强化学习算法旨在通过使用扩展记忆系统来利用过去经验以克服这一问题。然而,这些记忆增强通常仅用作缓冲区,从中对孤立事件进行离线重采样(例如回放)。在本文中,我们介绍了顺序回合并发控制(SEC),这是一种海马体启发的模型,按时间顺序存储完整的事件序列,并在检索时采用顺序偏差来指导行动。我们在Animal-AI测试平台的多个基准上评估了SEC,证明了其相较于模型无关的回合并发控制、深度Q网络以及具有关联记忆的回合并发强化学习等几种当前最优模型的优越性能和样本效率。我们的实验表明,在需要记忆和决策的任务中,SEC能实现更高的奖励和更快的策略收敛。此外,我们研究了记忆约束和遗忘机制的影响,揭示优先遗忘能同时提升性能和策略稳定性。进一步地,消融研究证明了顺序记忆组件在SEC中的关键作用。最后,我们讨论了快速、顺序性海马体式回合并发记忆系统如何支持人工和生物系统中的习惯形成和审慎思考。
Keyword:
HIPPOCAMPUS
CELLS
OSCILLATIONS
PREFERENCE
MECHANISM
DECISIONS
LEVEL

期刊

Nature Machine Intelligence 封面图
Nature Machine Intelligence
IF:
23.9
论文数:
1.3K
被引数:
1.5W

机构

U
Univ Miguel Hernandez Elche
学者数:
44
论文数: 23
被引数: 1
引用论文

引用论文

err分享
err收藏
err分享
err收藏
The Mechanism of Rate Remapping in the Dentate Gyrus
errNEURON
IF15
err2010-12-01
err69
errOAAI
errRenno-Costa, Cesar; Lisman, John E.; Verschure, Paul F. M. J.
err分享
err收藏
Episodic-like memory during cache recovery by scrub jays
err1998-09-01
err0
PREAI
errNicola S. Clayton; Anthony Dickinson
err分享
err收藏
Insect-Like mapless navigation based on head direction cells and contextual learning using chemo-visual sensors
err2009-10-01
err0
PREAI
errZenon Mathews; Miguel Lechón; J.M. Blanco Calvo; Anant Dhir; Armin Duff; Sergi Bermúdez i Badia; Paul F.M.J. Verschure
err分享
err收藏
err分享
err收藏
err分享
err收藏
学者 查看更多内容