返回
Time-Sensitive Multi-DNN Inference on CPU-GPU Edge Platforms
DOI:10.1109/TMC.2025.3636950.png)
摘要
En 中文
近年来,深度神经网络(DNNs)在运行于配备异构多处理器的边缘平台上的多种时间关键型应用中得到了越来越广泛的应用。鉴于这些平台上的资源有限,高效利用CPU和GPU资源进行时间敏感的DNN推理至关重要。然而,这种跨处理器推理范式由于不同处理器之间固有的性能不平衡而面临重大挑战。在本文中,我们介绍了BlastNet系统,该系统利用duo-blocks——一种新颖的模型推理抽象,旨在实现高效、时间敏感的跨处理器DNN推理。每个duo-block具有双模型结构,便于在不同处理器之间进行细粒度、交替的推理。Duo-blocks在设计阶段进行优化,并在运行时动态调度,以最大化CPU和GPU的资源利用率。为了解决边缘设备上的内存限制,我们还提出了一种duo-block选择算法,该算法根据性能增益有选择地构建duo-blocks。BlastNet在一个室内自动驾驶平台和三个流行的边缘平台上实现。广泛的评估表明,BlastNet在仅损失1.63%模型精度的情况下,将截止时间未命中率降低了35.07%。
Keyword:
Edge artificial intelligence
concurrent DL execution
real-time scheduling
neural architecture search
on-device deep learning
期刊
IF:
9.2
论文数:
5.8K
被引数:
1.8W

