返回
Reinforcement Learning for Warehouse Management Using a Scenario-Based Simulation Testbed
DOI:10.3390/ai7080308.png)
摘要
En 中文
仓库作业涉及动态物品流动、波动需求和异构布局,使得自适应决策对于高效存储和订单履行至关重要。在此背景下,强化学习(RL)为在随机环境下学习自适应仓库控制策略提供了一种有前景的方法。然而,在真实仓库环境中评估基于RL的解决方案往往成本高昂且耗时,这促使需要真实且可复现的模拟环境。在本文中,我们介绍了一个可配置的仓库模拟环境,该环境模拟了随机物品到达、订单生成以及不同布局和工作负载条件下的内部物流作业。基于此环境,我们构建了一个由多个场景组成的可复现实验测试平台,这些场景范围从低负载到高度拥堵的设置。该测试平台已公开发布,以支持可复现的研究和学术界的比较评估。我们将仓库管理问题表述为马尔可夫决策过程(MDP),并应用可掩码的近端策略优化(Maskable PPO)代理来学习自适应控制策略。基于RL的方法在定义的场景中进行评估,并与启发式基线策略进行比较。实验结果表明,所提出的解决方案在性能上与强大的贪婪先进先出(FIFO)启发式方法相当,同时在具有挑战性的工作负载条件下将订单履行率提高了高达13.5个百分点。这些结果证明了RL能够学习稳健的仓库控制策略,这些策略能够自适应地优化性能并在广泛的不同场景中保持运营稳定。
Keyword:
warehouse management
reinforcement learning
simulation-based testbed
scenario-based evaluation
stochastic environments
autonomous warehouse operations
期刊
A
IF:
5
论文数:
1.0K
被引数:
941
机构
引用论文
Optimization Algorithm of Intelligent Warehouse Management System Based on Reinforcement Learning基于强化学习的智能仓储管理系统优化算法
Hosseini, M.; Chalil Madathil, S.; Khasawneh, M.T. Reinforcement Learning-Based Simulation Optimization for an Integrated Manufacturing-Warehouse System: A Two-Stage Approach. Expert Syst. Appl. 2025, 290, 128259. [Google Scholar] [CrossRef]Hosseini, M.; Chalil Madathil, S.; Khasawneh, M.T. 基于强化学习的集成制造-仓库系统仿真优化:一种两阶段方法。Expert Syst. Appl. 2025, 290, 128259. [Google Scholar] [CrossRef]
A least squares temporal difference actor–critic algorithm with applications to warehouse management


