返回
Enable importance-aware model cacheability for inference serving
DOI:10.1016/j.engappai.2025.111908.png)
摘要
En 中文
推理服务系统被用于将深度学习(DL)模型作为服务进行部署。加速器(如图形处理单元(GPUs))已在这些系统中被广泛使用,以减少模型执行时间。随着加速器变得更为强大且昂贵,不同推理请求之间的DL模型共享GPU成为一种常见做法。然而,当共置模型的数量增加时,GPU内存容量会成为瓶颈,使得这种方法不可持续。与此同时,共置模型的流行程度可能各不相同——有些模型被频繁访问,而另一些则不然,这导致资源利用率和系统性能低下。尽管一些现有的推理服务系统提供了在内存中动态加载和缓存模型的能力,但它们通常是局部性感知的,并且在深度学习推理服务中表现出较差的性能。
Keyword:
GPU sharing
deep learning models
inference serving
GPU memory capacity
dynamic loading
期刊
IF:
8
论文数:
5.4K
被引数:
3.5W

