返回
Multi-trajectory optimization for train using distributional reinforcement learning with conditional value-at-risk
DOI:10.1016/j.asoc.2025.113079.png)
摘要
En 中文
人工智能方法如强化学习(RL)已被广泛研究用于训练轨迹优化问题,以实现灵活驾驶。为满足实际运营中对灵活驾驶策略的需求,通常基于不同的计划时间生成N条针对单列车的优化轨迹。这引出了两个问题:N条轨迹的计算成本是单条轨迹的N倍,且需要人工干预来调整初始条件,如计划时间。本文提出一种基于条件风险价值(CVaR)的分布式Q学习(CDQ)方法,用于生成不同驾驶风格的轨迹,并平衡安全性与效率。首先,通过分析实际控制偏差,利用分布式强化学习中的分位数对回报分布进行建模。然后,引入CVaR作为风险指标评估动作风险,基于不同置信水平开发风险敏感策略,同时优化单列车的多条轨迹。最后,使用实际线路数据进行仿真实验。结果表明,CDQ算法无需人工干预即可同时优化多条列车轨迹。通过双层选择机制,可选取五种具有不同驾驶风格的轨迹以满足调度灵活性需求。与标准Q学习、分布式深度Q网络及其他风险敏感强化学习相比,CDQ在节能与准点性方面均表现出更优性能。CDQ的总计算时间仅为Q学习和风险敏感强化学习的31.47%和35.44%。
Keyword:
Train trajectory optimization
Distributional reinforcement learning
Conditional value-at-risk

