返回
nnWeb: Towards efficient WebGPU-based DNN inference via automatic collaborative offloading
DOI:10.1016/j.comnet.2025.111489.png)
摘要
En 中文
在浏览器中的神经网络推理为跨平台AI应用带来了前景,但在资源受限设备上面临着严重的延迟和能耗挑战。本文提出nnWeb,一个基于WebGPU的浏览器内神经网络推理框架,具有优化的延迟和能耗效率。nnWeb动态分割神经网络,并促进客户端浏览器与服务器之间的协同卸载。nnWeb运行分为两个阶段:(1)基于层隔离的配置文件分析,用于预测异构硬件上每层的执行延迟和能耗;以及(2)基于异步执行的DNN分割,持续监控网络带宽和设备负载,利用WebGPU的原生流水线并行ism选择最佳分割点,通过运行时求解闭合式优化来最小化总延迟或能耗。在多种浏览器内AI模型和网络条件下的广泛评估表明,与静态分割相比,nnWeb实现了30%至52%的总推理延迟平均减少。此外,与独立的浏览器推理相比,nnWeb实现了11.3%至44.0%的能耗节省。
期刊
IF:
4.6
论文数:
1.6K
被引数:
1.6W
机构
暂无机构信息
引用论文
Finding gene network topologies for given biological function with recurrent neural network
NATURE COMMUNICATIONS
IF15.7

