arrow
返回

Enable importance-aware model cacheability for inference serving

delete2025-08-09
delete0
PRE
AI
H
Hao Mo
D
Didier El Baz
L
Ligu Zhu
S
Suping Wang
S
Songfu Tan
H
Hongning Zhao
L
Lei Shi *
DOI:10.1016/j.engappai.2025.111908delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
推理服务系统被用于将深度学习(DL)模型作为服务进行部署。加速器(如图形处理单元(GPUs))已在这些系统中被广泛使用,以减少模型执行时间。随着加速器变得更为强大且昂贵,不同推理请求之间的DL模型共享GPU成为一种常见做法。然而,当共置模型的数量增加时,GPU内存容量会成为瓶颈,使得这种方法不可持续。与此同时,共置模型的流行程度可能各不相同——有些模型被频繁访问,而另一些则不然,这导致资源利用率和系统性能低下。尽管一些现有的推理服务系统提供了在内存中动态加载和缓存模型的能力,但它们通常是局部性感知的,并且在深度学习推理服务中表现出较差的性能。
Keyword:
GPU sharing
deep learning models
inference serving
GPU memory capacity
dynamic loading

期刊

Engineering Applications of Artificial Intelligence 封面图
Engineering Applications of Artificial Intelligence
IF:
8
论文数:
5.4K
被引数:
3.5W

机构

C
Communication University of China
学者数:
1.1K
论文数: 820
被引数: 326
Université de Toulouse 封面图
Université de Toulouse
学者数:
1.5K
论文数: 604
被引数: 2.3W