返回
Learning Robust Representations via Bidirectional Transition for Visual Reinforcement Learning
DOI:10.1145/3765517.png)
摘要
En 中文
视觉强化学习已展现出解决具有高维观测的控制任务的效能。然而,一个核心挑战在于如何从基于视觉的观测中推导出可靠且泛化的表征。受人类思维过程的启发,当从观测中提取的视觉表征能够预测未来并追溯历史时,该表征在理解环境状态方面是可靠且准确的。基于此概念,我们引入了一种双向转换(BT)框架用于表征学习。该框架采用正向和反向环境转换的双向预测作为辅助任务,以提取可靠表征。此外,我们引入了一个逆动力学模型来预测导致环境状态转换的动作,从而学习状态表征的任务相关性。在DeepMind Control套件的两个设置中,我们的方法展示了具有竞争力的泛化性能和样本效率。此外,我们利用机器人操作模拟器、自动驾驶模拟器CARLA以及视觉导航模拟器Habitat来展示我们方法广泛的适用性。结果表明,BT提供了更稳定可靠的表征,并表现出对视觉强化学习任务强大的泛化性能。
期刊
机构
暂无机构信息
引用论文
Leslie Pack Kaelbling, Michael L. Littman, and Anthony R. Cassandra. 1998. Planning and acting in partially observable stochastic domains. Artificial Intelligence 101, 1–2 (1998), 99–134.Leslie Pack Kaelbling,Michael L. Littman 和 Anthony R. Cassandra。1998年。部分可观测随机域中的规划与行动。人工智能 101, 1–2 (1998),99–134。
Keerthana Sivamayil, Elakkiya Rajasekar, Belqasem Aljafari, Srete Nikolovski, Subramaniyaswamy Vairavasundaram, and Indragandhi Vairavasundaram. 2023. A systematic study on reinforcement learning based applications. Energies 16, 3 (2023), 1512.Keerthana Sivamayil, Elakkiya Rajasekar, Belqasem Aljafari, Srete Nikolovski, Subramaniyaswamy Vairavasundaram, Indragandhi Vairavasundaram. 2023. 基于强化学习应用的一项系统性研究。Energies 16, 3 (2023), 1512.
Bolei Zhou, Agata Lapedriza, Aditya Khosla, Aude Oliva, and Antonio Torralba. 2017. Places: A 10 million image database for scene recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence 40, 6 (2017), 1452–1464.Bolei Zhou, Agata Lapedriza, Aditya Khosla, Aude Oliva, and Antonio Torralba. 2017. Places: 一个用于场景识别的1000万图像数据库。IEEE Transactions on Pattern Analysis and Machine Intelligence 40, 6 (2017), 1452–1464.

