返回
Device-Cloud Collaborative LLM Inference With Multi-Modal, Multi-Task, and Multi-Turn Conversations
DOI:10.1109/ton.2026.3712685.png)
摘要
En 中文
与传统机器学习模型相比,近期的大型语言模型(LLMs)可通过多模态数据源和多轮对话展现多任务解决能力。这些LLMs的独特特性及其庞大的模型规模使其部署更具挑战性。具体而言,1) 在设备上部署LLMs面临计算、内存和能源资源问题,而2) 在云端部署无法保证实时服务并产生通信/使用成本。在本文中,我们设计了TMO,一个具有三模态卸载(多模态、多任务和多轮对话)的设备-云端LLM推理系统。TMO整合了1) 一个轻量级设备端LLM,可高速处理简单任务,以及2) 一个大规模云端LLM,可处理多模态数据源。我们为TMO开发了一种资源受限强化学习(RCRL)策略,用于优化多轮对话中每个任务的推理位置(即设备与云端)和使用的多模态数据源,旨在遵循资源约束的同时最大化长期回报(响应质量、延迟和使用成本)。我们还贡献了M4A1,一个我们整理的新数据集,涵盖多模态、多任务、多轮对话和LLM配置,以支持卸载决策的评估。我们展示了TMO相较于多个探索-决策和LLM作为路由器基线的有效性,在延迟、成本和响应质量方面均显示出显著改进。我们的代码和数据集可通过https://github.com/liangqiyuan/TMO获取。
Keyword:
Large language model
reinforcement learning
multi-modal
collaborative inference
resource constraint
期刊
I
IF:
3.6
论文数:
4.4K
被引数:
9.5K
机构
引用论文
Large Language Models (LLMs) Inference Offloading and Resource Allocation in Cloud-Edge Computing: An Active Inference Approach云边缘计算中的大型语言模型 (llm) 推理卸载和资源分配: 一种主动推理方法

