返回
Multi-Turn Reasoning LLMs for Task Offloading in Mobile Edge Computing
DOI:10.1109/tmc.2026.3730886.png)
摘要
En 中文
新兴的计算密集型应用对资源受限的移动设备提出了严格的延迟要求。移动边缘计算(MEC)通过任务卸载应对这一挑战。然而,由于动态任务到达、时变信道以及服务器队列的空间-时间耦合,设计有效策略仍然困难。传统启发式方法缺乏适应性,而深度强化学习(DRL)受限于泛化能力和架构刚性,在改变网络拓扑时需要重新训练。尽管大型语言模型(LLMs)提供了语义推理能力,但标准的监督微调(SFT)产生的策略具有短视性,贪婪地最小化即时延迟而未考虑长期系统演化。为解决这些限制,我们提出多轮大型语言模型协同优化(COMLLM),一种生成式框架,可在MEC系统中实现前瞻性决策。COMLLM整合了群体相对策略优化(GRPO)与前瞻协同仿真(LACS)机制,该机制在执行多步蒙特卡洛展开的同时联合建模服务器队列动态。通过将这些展开纳入奖励设计,该框架捕捉当前决策对未来的长期影响。实验结果表明,COMLLM实现了近最优延迟和改进的负载均衡公平性。值得注意的是,它表现出零样本拓扑可扩展性,允许在小规模网络上训练的模型泛化到更大的未见拓扑,而无需重新训练,优于SFT、DRL和启发式基线。
Keyword:
Group relative policy optimization
large language models
mobile edge computing
task offloading
zero-shot scalability
期刊
IF:
9.2
论文数:
5.8K
被引数:
1.8W
机构
引用论文
暂无论文信息

