arrow
返回

Efficient Classification-Based Constraints for Offline Reinforcement Learning

delete2025-11-17
delete0
delete
OA
AI
C
Chayoung Kim *
DOI:10.3390/app152212197delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
现有的基于分布的离线强化学习约束,如引导式误差累积减少(BEAR),能够防止策略偏离,但常常忽略动作质量,导致O(n²)的复杂度和有限的可解释性。本研究引入了一种基于分类的方法,采用成对动作质量比较来替代复杂的分布约束。一个二元分类器通过比较两个动作在同一状态下的Q值来学习它们的相对质量,在优先进行价值感知选择的同时保持保守行为。在基准环境中的实验表明,所提出的方法始终优于BEAR,平均提升3倍,在某些环境中最高提升5倍。该算法将计算复杂度从O(n²)降低到O(n),并通过分类器准确率提供直观的监控。这些结果表明,高效的质量比较可以作为离线强化学习中计算昂贵的分布约束的实用且高效的替代方案,在性能和可扩展性方面均实现了实际收益。
Keyword:
offline reinforcement learning
classification-based constraints
action quality comparison
conservative policy optimization
computational efficiency
Q-value estimation
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

A
Applied Sciences-Basel
IF:
2.5
论文数:
7.6K
被引数:
4

机构

Hankyong National University 封面图
Hankyong National University
学者数:
840
论文数: 1.0K
被引数: 759
引用论文

引用论文

Human-level control through deep reinforcement learning通过深度强化学习实现人类层面的控制
err2015-02-25
err0
PREAI
errVolodymyr Mnih; Koray Kavukcuoglu; David Silver; Andrei A. Rusu; Joel Veness; Marc G. Bellemare; Alex Graves; Martin Riedmiller; Andreas K. Fidjeland; Georg Ostrovski; Stig Petersen; Charles Beattie; Amir Sadik; Ioannis Antonoglou; Helen King; Dharshan Kumaran; Daan Wierstra; Shane Legg; Demis Hassabis
err分享
err收藏
err1999-01-01
err0
PREAI
errPedro Domingos
err分享
err收藏
Learning to rank
err2007-06-20
err0
PREAI
errZhe Cao; Tao Qin; Tie-Yan Liu; Ming-Feng Tsai; Hang Li
err分享
err收藏
Learning to rank using gradient descent
err2005-01-01
err0
PREAI
errChris Burges; Tal Shaked; Erin Renshaw; Ari Lazier; Matt Deeds; Nicole Hamilton; Greg Hullender
err分享
err收藏
Batch Reinforcement Learning
err2012-01-01
err0
PREAI
errSascha Lange; Thomas Gabel; Martin Riedmiller
err分享
err收藏
没有更多内容