arrow
返回

Adversarial Imitation Learning With General Function Approximation: Theoretical Analysis and Practical Algorithms

delete2026-01-26
delete0
PRE
AI
T
Tian Xu
Z
Zhilong Zhang
Z
Zexuan Chen
R
R. Chen
Y
Yihao Sun
Y
Yang Yu
DOI:10.1109/TPAMI.2026.3657578delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
对抗模仿学习(AIL)作为一种模仿学习的重要方法,在神经网络逼近的推动下取得了显著的实践成功。然而,现有对AIL的理论分析主要局限于简化设置(如表格和线性函数逼近),并涉及复杂的算法设计,阻碍了实际应用。这造成了理论与实践之间的巨大鸿沟。本文通过探索具有一般函数逼近的在线AIL的理论基础来弥合这一鸿沟。我们引入了一种名为基于优化的AIL(OPT-AIL)的新框架,该框架执行在线优化以进行奖励学习,并结合乐观正则化优化以进行策略学习。在此框架内,我们开发了两种具体方法:无模型OPT-AIL和基于模型的OPT-AIL。我们的理论分析表明,这两种变体在接近专家策略的学习中均实现了多项式专家样本复杂度和交互复杂度。据我们所知,它们代表了在一般函数逼近条件下首次得到证明的高效AIL方法。从实践角度看,OPT-AIL仅需对两个目标进行近似优化,从而便于实际实现。经验研究表明,OPT-AIL在多个具有挑战性的任务中超越了以往最先进的深度AIL方法。
Keyword:
Imitation learning
adversarial learning
general function approximation
learning theory

期刊

IEEE Transactions on Pattern Analysis and Machine Intelligence 封面图
IEEE Transactions on Pattern Analysis and Machine Intelligence
IF:
18.6
论文数:
864
被引数:
9.8W

机构

M
mila-quebec artificial intelligence institute
学者数:
2
论文数: 2
被引数: 0
N
nanjing university
学者数:
7.8W
论文数: 5.6W
被引数: 87
引用论文

引用论文

Adversarial Model for Offline Reinforcement Learning
err2023-01-01
err0
PREAI
errBhardwaj,Mohak; Xie,Tengyang; Boots,Byron; Jiang,Nan; Cheng,Ching-An
err分享
err收藏
Introduction to Online Convex Optimization
err
IF0
err2016-01-01
err0
errOAAI
errElad Hazan
err分享
err收藏
err分享
err收藏
Human-level control through deep reinforcement learning通过深度强化学习实现人类层面的控制
err2015-02-25
err0
PREAI
errVolodymyr Mnih; Koray Kavukcuoglu; David Silver; Andrei A. Rusu; Joel Veness; Marc G. Bellemare; Alex Graves; Martin Riedmiller; Andreas K. Fidjeland; Georg Ostrovski; Stig Petersen; Charles Beattie; Amir Sadik; Ioannis Antonoglou; Helen King; Dharshan Kumaran; Daan Wierstra; Shane Legg; Demis Hassabis
err分享
err收藏
π₀: A Vision-Language-Action Flow Model for General Robot Control
err
err0
PREAI
errBlack,Kevin; Brown,Noah; Driess,Danny; Esmail,Adnan; Equi,Michael; Finn,Chelsea; Fusai,Niccolo; Groom,Lachy; Hausman,Karol; Ichter,Brian; Jakubczak,Szymon; Jones,Tim; Ke,Liyiming; Levine,Sergey; Li-Bell,Adrian; Mothukuri,Mohith; Nair,Suraj; Pertsch,Karl; Shi,Lucy; Smith,Laura; Tanner,James; Vuong,Quan; Walling,Anna; Wang,Haohuan; Zhilinsky,Ury
err分享
err收藏
学者 查看更多内容