arrow
返回

Flow-Graph-Aware Tiling and Rescheduling for Memory-Efficient On-Device Inference

delete2026-01-01
delete0
PRE
AI
J
Jeong, Yeonoh *
P
Park, Taehyeong
P
Park, Yongjun
DOI:10.1109/CGO68049.2026.11395230delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
随着人工智能(AI)应用的日益普及,深度神经网络(DNNs)在各种实际应用领域中对设备端服务提出了需求。在资源受限的边缘设备上运行DNN推理需要积极的内存优化。虽然几种近年基于分块的技术通过将大张量分割为微张量来降低峰值内存使用量,但它们专门针对MCU环境,且不具备对不同边缘平台的扩展性。此外,它们在分割时贪婪地寻找分块目标,而未考虑模型中分割时的内存流。本文提出OKO,一种基于编译器的优化技术,通过考虑分块和相应的操作重排来最小化峰值内存使用量。OKO基于张量的生命周期和依赖关系估计分块方法带来的内存节省,然后算法化地选择最优分块策略。它进一步通过高效地重排操作并立即释放不必要的张量来最大化内存空间的复用。在多种边缘设备上的评估表明,OKO实现了高达80%的有效内存节省,平均为59%,且不损失精度和产生可忽略的开销,支持在广泛的目标设备上实现内存高效的推理。
Keyword:
Memory Optimization
Compiler
DNN
Edge-device
On-device

期刊

2
2026 IEEE/ACM INTERNATIONAL SYMPOSIUM ON CODE GENERATION AND OPTIMIZATION, CGO
IF:
0
论文数:
48
被引数:
0

机构

Y
Yonsei University
学者数:
4.8W
论文数: 4.6W
被引数: 5.2W
引用论文

引用论文

Algorithms for two bottleneck optimization problems
err1988-09-01
err0
errOAAI
errHarold N Gabow; Robert E Tarjan
err分享
err收藏
A survey of deep learning techniques for autonomous driving面向自动驾驶的深度学习技术综述
err2019-11-14
err1.0K
errOAAI
errGrigorescu, Sorin; Trasnea, Bogdan; Cocias, Tiberiu; Macesanu, Gigel
err分享
err收藏
学者 查看更多内容