返回
Flow-Graph-Aware Tiling and Rescheduling for Memory-Efficient On-Device Inference
DOI:10.1109/CGO68049.2026.11395230.png)
摘要
En 中文
随着人工智能(AI)应用的日益普及,深度神经网络(DNNs)在各种实际应用领域中对设备端服务提出了需求。在资源受限的边缘设备上运行DNN推理需要积极的内存优化。虽然几种近年基于分块的技术通过将大张量分割为微张量来降低峰值内存使用量,但它们专门针对MCU环境,且不具备对不同边缘平台的扩展性。此外,它们在分割时贪婪地寻找分块目标,而未考虑模型中分割时的内存流。本文提出OKO,一种基于编译器的优化技术,通过考虑分块和相应的操作重排来最小化峰值内存使用量。OKO基于张量的生命周期和依赖关系估计分块方法带来的内存节省,然后算法化地选择最优分块策略。它进一步通过高效地重排操作并立即释放不必要的张量来最大化内存空间的复用。在多种边缘设备上的评估表明,OKO实现了高达80%的有效内存节省,平均为59%,且不损失精度和产生可忽略的开销,支持在广泛的目标设备上实现内存高效的推理。
Keyword:
Memory Optimization
Compiler
DNN
Edge-device
On-device
期刊
机构
引用论文
FlexNN: Efficient and Adaptive DNN Inference on Memory-Constrained Edge DevicesFlexNN:面向内存受限边缘设备的DNN推理的高效与自适应方法

