返回
Reinforcement learning-based algorithm for the dynamic multi-depot crowdsourced delivery problem
DOI:10.1016/j.eswa.2025.127818.png)
摘要
En 中文
该行业日益关注众包解决方案,其中临时司机通过在线众包平台(OCP)提供服务。本研究考察了一个动态环境,OCP接收实时配送任务并将其分配给这些临时司机。司机从多个仓库收集物品并交付给客户。众包车辆的到达也是动态的。这种场景引入了车辆路径问题的一个新变体,即动态多仓库众包配送问题(DMDCDP)。它涉及将多个订单分组为批次,将每个订单批次分配给众包车辆,确定每个车辆从适当仓库收集所需订单批次的地点,并为众包车辆寻找最优路径。为最大化OCP在整个规划期内的总收益,本研究将未来订单和车辆的预期时空特征纳入DMDCDP的当前决策过程中。这是通过开发马尔可夫决策过程(MDP)模型并提出基于强化学习框架的混合算法NSTDKM实现的。该算法整合了改进的自适应大邻域搜索(IALNS)技术用于订单分批和仓库分配,以及基于时序差分的库恩-曼克雷斯特技术用于车辆分配和路径规划。共进行了7740组实验以检验NSTDKM算法的性能。对于所有案例,NSTDKM始终优于两种现有算法,并提升了OCP的整体收益。平均而言,NSTDKM相较于这两种算法分别提升了35.7%和21.7%。消融实验进一步验证了NSTDKM的有效性,其在93%的案例中实现了OCP的最佳整体收益,相较于三种对比算法分别平均提升了13.17%、9.2%和2.7%。NSTDKM离线训练的价值表也显示出对具有不同时间和空间分布及需求分布的新案例的强泛化能力。此外,NSTDKM在不同决策频率下表现良好。
Keyword:
Dynamic crowdsourced delivery
Multiple depots
Order batching
Anticipated future gain
Reinforcement learning

