返回
Offline Diffusion Policy for Multi-User Delay-Constrained Scheduling
DOI:10.1109/tmc.2026.3689753.png)
摘要
En 中文
有效的多用户延迟约束调度在各种实际应用中至关重要,包括具身人工智能、即时消息、直播和数据中心管理,这些场景需要在不同延迟敏感度的用户之间进行高效资源分配。在这些场景中,调度器必须在无系统动力学先验知识的情况下做出实时决策,以满足延迟和资源约束,而系统动力学通常是时变的且难以估计。当前基于学习的方法通常需要在训练阶段与实际系统进行在线交互。因此,这些方法往往难以实现或不切实际,因为它们会显著降低系统性能并产生巨大的服务成本。为解决这些挑战,我们提出了一种新颖的基于离线强化学习的算法,命名为SOCD(通过离线学习与判别器引导和扩散模型进行调度),从预收集的离线数据中学习高效调度策略。SOCD创新性地采用扩散策略,并辅以无采样判别器网络进行策略引导。通过将拉格朗日乘数优化整合到离线强化学习中,SOCD仅从可用数据集中高效训练高质量的自约束策略,无需与系统进行在线交互。实验结果表明,SOCD对各种系统动力学具有鲁棒性,包括部分可观测和大规模环境,并且相比现有方法表现出更优越的性能。
Keyword:
Delay-constrained scheduling
offline reinforcement learning
diffusion policy
期刊
IF:
9.2
论文数:
5.6K
被引数:
1.8W
机构
引用论文
Joint Message-Passing and Convex Optimization Framework for Energy-Efficient Surveillance UAV Scheduling
Electronics
IF0
Low-carbon optimal learning scheduling of the power system based on carbon capture system and carbon emission flow theory基于碳捕集系统和碳排放流理论的电力系统低碳优化学习调度

