返回
Adversarial Imitation Learning With General Function Approximation: Theoretical Analysis and Practical Algorithms
DOI:10.1109/TPAMI.2026.3657578.png)
摘要
En 中文
对抗模仿学习(AIL)作为一种模仿学习的重要方法,在神经网络逼近的推动下取得了显著的实践成功。然而,现有对AIL的理论分析主要局限于简化设置(如表格和线性函数逼近),并涉及复杂的算法设计,阻碍了实际应用。这造成了理论与实践之间的巨大鸿沟。本文通过探索具有一般函数逼近的在线AIL的理论基础来弥合这一鸿沟。我们引入了一种名为基于优化的AIL(OPT-AIL)的新框架,该框架执行在线优化以进行奖励学习,并结合乐观正则化优化以进行策略学习。在此框架内,我们开发了两种具体方法:无模型OPT-AIL和基于模型的OPT-AIL。我们的理论分析表明,这两种变体在接近专家策略的学习中均实现了多项式专家样本复杂度和交互复杂度。据我们所知,它们代表了在一般函数逼近条件下首次得到证明的高效AIL方法。从实践角度看,OPT-AIL仅需对两个目标进行近似优化,从而便于实际实现。经验研究表明,OPT-AIL在多个具有挑战性的任务中超越了以往最先进的深度AIL方法。
Keyword:
Imitation learning
adversarial learning
general function approximation
learning theory
期刊
IF:
18.6
论文数:
864
被引数:
9.8W

