返回
A novel deep reinforcement learning method for solving resource-constrained multi-project scheduling problem: twin delayed deep deterministic policy gradient
DOI:10.1016/j.cie.2026.112048.png)
摘要
En 中文
本文介绍了一种基于双延迟深度确定性策略梯度(TD3)的新型强化学习框架,以有效解决资源受限的多项目调度问题(RCMPSP)。在所提出的框架中,调度问题被表述为马尔可夫决策过程(MDP)。所提出的方法利用TD3自主学习最优调度策略,无需大量超参数调整。该框架是TD3在RCMPSP中的首次应用,为深度强化学习(DRL)在复杂调度问题研究领域的不断增长的研究做出了贡献。该模型在MPSPLIB数据集上进行训练以研究其有效性。结果表明,结合敏感性分析,所提出的框架显著提高了计算效率和解的质量。具体而言,TD3优于深度确定性策略梯度(DDPG)基线和基于学习的最优启发式元启发式算法。通过Wilcoxon符号秩检验对改进进行了统计验证,证实了TD3的优越性。所提出的方法在资源分配方面实现了改进,从而减少了项目工期。结果表明,该框架为动态环境中的多项目调度提供了可扩展和自适应的策略,具有重要的管理价值。
Keyword:
Resource-constrained multi-project scheduling problem
Deep reinforcement learning
Twin-delayed deep deterministic policy gradient
Markov decision process
期刊
C
IF:
6.5
论文数:
575
被引数:
0
机构
引用论文
A combined multi-agent system for distributed multi-project scheduling problems分布式多项目调度问题的组合多agent系统
Sensitivity Analysis of Reinforcement Learning-Based Hybrid Electric Vehicle Powertrain Control基于强化学习的混合动力汽车动力传动系统控制的敏感性分析

