arrow
返回

Offline Diffusion Policy for Multi-User Delay-Constrained Scheduling

delete2026-05-01
delete0
PRE
AI
Z
Zhuoran Li
R
Ruishuo Chen
H
Hai Zhong
L
Longbo Huang
DOI:10.1109/tmc.2026.3689753delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
有效的多用户延迟约束调度在各种实际应用中至关重要,包括具身人工智能、即时消息、直播和数据中心管理,这些场景需要在不同延迟敏感度的用户之间进行高效资源分配。在这些场景中,调度器必须在无系统动力学先验知识的情况下做出实时决策,以满足延迟和资源约束,而系统动力学通常是时变的且难以估计。当前基于学习的方法通常需要在训练阶段与实际系统进行在线交互。因此,这些方法往往难以实现或不切实际,因为它们会显著降低系统性能并产生巨大的服务成本。为解决这些挑战,我们提出了一种新颖的基于离线强化学习的算法,命名为SOCD(通过离线学习与判别器引导和扩散模型进行调度),从预收集的离线数据中学习高效调度策略。SOCD创新性地采用扩散策略,并辅以无采样判别器网络进行策略引导。通过将拉格朗日乘数优化整合到离线强化学习中,SOCD仅从可用数据集中高效训练高质量的自约束策略,无需与系统进行在线交互。实验结果表明,SOCD对各种系统动力学具有鲁棒性,包括部分可观测和大规模环境,并且相比现有方法表现出更优越的性能。
Keyword:
Delay-constrained scheduling
offline reinforcement learning
diffusion policy

期刊

IEEE Transactions on Mobile Computing 封面图
IEEE Transactions on Mobile Computing
IF:
9.2
论文数:
5.6K
被引数:
1.8W

机构

T
tsinghua university
学者数:
11.9W
论文数: 10.0W
被引数: 137
引用论文

引用论文

Network Topology Optimization via Deep Reinforcement Learning基于深度强化学习的网络拓扑优化
err2023-05-01
err11
errOAAI
errLi, Zhuoran; Wang, Xing; Pan, Ling; Zhu, Lin; Wang, Zhendong; Feng, Junlan; Deng, Chao; Huang, Longbo
err分享
err收藏
A queuing theory model for fog computing
err2022-02-07
err0
errOAAI
errLluís Mas; Jordi Vilaplana; Jordi Mateo; Francesc Solsona
err分享
err收藏
学者 查看更多内容