arrow
返回

MD2I: Multi-device model-distributed neural network inference in split computing

delete2026-08-15
delete0
PRE
AI
M
Milin Zhang *
T
Tanzil B. Hassan
M
Mohammad Abdi
V
Venkat Dasari
F
Francesco Restuccia
DOI:10.1016/j.comnet.2026.112678delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
分布式推理已作为一种有前景的解决方案,用于在资源受限设备上部署和加速大型神经网络。现有方法大多沿宽度维度分割计算,因此由于卷积神经网络(CNN)中输入区域的重叠和transformers中聚合全局信息所需的大量通信开销,导致额外的计算开销和显著的通信开销。此外,它们要求设备存储和执行整个模型,从而产生巨大的内存开销。与此相反,本文提出MD2I,一种可扩展的多设备模型分布式推理框架,将神经网络沿深度维度划分,即每个设备仅执行部分层。与现有方法不同,我们考虑了动态无线网络环境以及节点故障的可能性。为此,我们引入了层冗余以提高容错能力,并数学化表述了分层最优层分配与复制问题(HOLARP),该问题优先考虑正常情况下的性能,同时在主执行失败时启用高效的备份路径。我们从理论上证明了HOLARP的NP难度,并采用两阶段深度强化学习(DRL)框架,以实时适应变化的网络条件。我们在Colosseum上的同构设备仿真和异构边缘设备真实测试床中,对包括ConvNeXt和Vision Transformer(ViT)在内的最先进神经网络进行了全面评估。实验结果表明,MD2I与本地计算相比可实现高达3.7倍的推理加速,与现有基线相比可实现1.8倍的加速,且优化开销小于8毫秒。
Keyword:
Distributed inference
Edge computing
Model partitioning
Latency optimization
Split computing

期刊

Computer Networks 封面图
Computer Networks
IF:
4.6
论文数:
1.7K
被引数:
1.6W

机构

N
Northeastern University
学者数:
2.5W
论文数: 1.6W
被引数: 3.0W
A
army research laboratory
学者数:
96
论文数: 55
被引数: 0
引用论文

引用论文

暂无论文信息