返回
Exploring SLO-aware GPU Function Overselling in Multi-tenant FaaS Platforms
DOI:10.1109/tc.2026.3732660.png)
摘要
En 中文
近年来,使用无服务器计算服务机器学习(ML)模型已成为一种越来越普遍的做法。如今许多云服务提供商已提供GPU函数以满足不同ML场景的性能需求。然而,现有的生产级函数即服务(FaaS)平台由于GPU资源管理不善,导致GPU利用率低下和云成本高昂。在本文中,我们提出了gShare,一种面向FaaS平台的按需、高效的GPU函数管理策略。gShare为基于虚拟机的多租户FaaS环境提供了细粒度的GPU虚拟化解决方案。它进一步将GPU资源与现有的面向CPU的函数管理范式解耦,从而实现跨租户的灵活GPU共享。通过动态且服务等级目标(SLO)感知的GPU超额配置策略设计,gShare能够在不引起用户端可察觉性能下降的情况下,安全地提高GPU函数的成本效益。实验结果表明,与基线相比,gShare可将GPU使用量降低43%–63%,同时满足超过95%的用户延迟目标。与最先进的方法相比,它还能将云成本降低24%-58%,同时保持更好的函数性能,使云服务提供商和用户双方受益。
Keyword:
Function-as-a-Service
GPU function
Virtualization
期刊
IF:
3.8
论文数:
5.4K
被引数:
9.8K
机构
引用论文
暂无论文信息

