arrow
返回

A novel deep reinforcement learning method for solving resource-constrained multi-project scheduling problem: twin delayed deep deterministic policy gradient

delete2026-05-23
delete0
PRE
AI
S
Sajad Soltan
M
Maryam Ashrafi *
E
Ehsan Nazerfard
DOI:10.1016/j.cie.2026.112048delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本文介绍了一种基于双延迟深度确定性策略梯度(TD3)的新型强化学习框架,以有效解决资源受限的多项目调度问题(RCMPSP)。在所提出的框架中,调度问题被表述为马尔可夫决策过程(MDP)。所提出的方法利用TD3自主学习最优调度策略,无需大量超参数调整。该框架是TD3在RCMPSP中的首次应用,为深度强化学习(DRL)在复杂调度问题研究领域的不断增长的研究做出了贡献。该模型在MPSPLIB数据集上进行训练以研究其有效性。结果表明,结合敏感性分析,所提出的框架显著提高了计算效率和解的质量。具体而言,TD3优于深度确定性策略梯度(DDPG)基线和基于学习的最优启发式元启发式算法。通过Wilcoxon符号秩检验对改进进行了统计验证,证实了TD3的优越性。所提出的方法在资源分配方面实现了改进,从而减少了项目工期。结果表明,该框架为动态环境中的多项目调度提供了可扩展和自适应的策略,具有重要的管理价值。
Keyword:
Resource-constrained multi-project scheduling problem
Deep reinforcement learning
Twin-delayed deep deterministic policy gradient
Markov decision process

期刊

C
Computers & Industrial Engineering
IF:
6.5
论文数:
575
被引数:
0

机构

A
amirkabir university of technology
学者数:
1.1K
论文数: 581
被引数: 0
引用论文

引用论文

Strong bounds for resource constrained project scheduling: Preprocessing and cutting planes
err2020-01-01
err18
errOAAI
errAraujo, Janniele A. S.; Santos, Haroldo G.; Gendron, Bernard; Jena, Sanjay Dominik; Brito, Samuel S.; Souza, Danilo S.
err分享
err收藏
Resource-constrained multi-project scheduling with activity and time flexibility
err2020-12-01
err30
errOAAI
errHauder, Viktoria A.; Beham, Andreas; Raggl, Sebastian; Parragh, Sophie N.; Affenzeller, Michael
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
学者 查看更多内容