返回
Efficient Classification-Based Constraints for Offline Reinforcement Learning
DOI:10.3390/app152212197.png)
摘要
En 中文
现有的基于分布的离线强化学习约束,如引导式误差累积减少(BEAR),能够防止策略偏离,但常常忽略动作质量,导致O(n²)的复杂度和有限的可解释性。本研究引入了一种基于分类的方法,采用成对动作质量比较来替代复杂的分布约束。一个二元分类器通过比较两个动作在同一状态下的Q值来学习它们的相对质量,在优先进行价值感知选择的同时保持保守行为。在基准环境中的实验表明,所提出的方法始终优于BEAR,平均提升3倍,在某些环境中最高提升5倍。该算法将计算复杂度从O(n²)降低到O(n),并通过分类器准确率提供直观的监控。这些结果表明,高效的质量比较可以作为离线强化学习中计算昂贵的分布约束的实用且高效的替代方案,在性能和可扩展性方面均实现了实际收益。
Keyword:
offline reinforcement learning
classification-based constraints
action quality comparison
conservative policy optimization
computational efficiency
Q-value estimation
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
A
IF:
2.5
论文数:
7.6K
被引数:
4


