arrow
Return

Adaptive Exploration Proximal Policy Optimization for Efficient Robotic Continuous Control

delete2026-04-24
delete0
PRE
AI
J
Jiajian Li *
L
Li, Mingrui
H
Hanshen Li
DOI:10.3390/sym18050717delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
Proximal Policy Optimization (PPO) is widely adopted for robotic continuous control, yet it can suffer from insufficient exploration and unstable policy updates in high-dimensional action spaces. This paper proposes Adaptive Exploration Proximal Policy Optimization (AE-PPO), an enhanced PPO framework that integrates (i) adaptive clipping, which adjusts the clipping range according to the observed magnitude of policy updates to better balance stability and learning progress, (ii) adaptive entropy regularization, which schedules the entropy weight across training to maintain effective exploration while avoiding excessive randomness. AE-PPO is evaluated on standard MuJoCo continuous control benchmarks (e.g., Walker2d, HalfCheetah, and Humanoid) and compared with PPO and representative baselines such as Trust Region Policy Optimization (TRPO) and Soft Actor Critic (SAC). The results show that AE-PPO achieves faster convergence and an improved final performance with reduced training variance, demonstrating more stable and efficient learning in challenging high-dimensional tasks.
Keywords:
reinforcement learning
PPO
adaptive exploration
robot control
continuous motion space

Journal

S
Symmetry-Basel
IF:
2.2
Papers:
1.4K
Citations:
0

Organization

G
goertek
Scholars:
27
Papers: 11
Citations: 0
D
Dalian University of Technology
Scholars:
5.9W
Papers: 4.4W
Citations: 5.5W