返回
Integrating Actor–Critic Reinforcement Learning With Evolutionary Algorithm for Multimodal Multiobjective Optimization
DOI:10.1109/TNNLS.2025.3624785.png)
摘要
En 中文
有效解决多模态多目标优化问题(MMOPs)需要在多样性和收敛性之间保持最佳平衡。传统算法在环境选择适应性方面往往面临挑战,导致在各类MMOPs中表现次优。本文创新性地将行为者-评价者强化学习(RL)与进化算法相结合,通过其行为者和评价者组件之间的协同在线学习,显著提升了环境选择适应性。建立了一个动态优化小生境大小的RL过程,该过程关键性地决定了多样性与收敛性偏好之间的权衡。该过程通过定义以下内容进行公式化:1)将收敛性和多样性度量作为状态;2)将小生境大小调整作为连续动作;3)将状态改进作为奖励。采用两个专门的完全连接神经网络,分别作为行为者网络用于动作生成和评价者网络用于价值估计,二者通过实时在线学习协同适应种群状态。这种自适应小生境技术,结合局部收敛质量评估,能够全面评估多样性和潜在收敛性。广泛的实验验证表明,所提算法在48个基准问题和实际应用中,相较于十种当前最先进的算法表现出更优性能。结果一致显示,与现有算法相比,在平衡维持和整体优化效果方面均有显著提升。
Keyword:
Actor–critic reinforcement learning (RL)
adaptability
local convergence quality
multimodal multiobjective optimization
niche size
期刊
IF:
8.9
论文数:
7.6K
被引数:
7.2W
机构
引用论文
Multimodal Multiobjective Evolutionary Optimization With Dual Clustering in Decision and Objective Spaces决策和目标空间中具有双重聚类的多模态多目标进化优化
Balancing Convergence and Diversity in Objective and Decision Spaces for Multimodal Multi-Objective Optimization平衡目标和决策空间中的收敛性和多样性,以实现多模态多目标优化
A Dynamic-Niching-Based Pareto Domination for Multimodal Multiobjective Optimization基于动态小范围的多峰多目标优化的帕累托控制
Tracking control of uncertain nonlinear systems with deferred asymmetric time-varying full state constraints
AUTOMATICA
IF5.9
A separation principle for the prescribed-time stabilization of a class of nonlinear systems一类非线性系统的规定时间稳定的分离原理
AUTOMATICA
IF5.9

