arrow
返回

Toward Efficient Edge AI With Heterogeneous Computing and Multilevel Optimization

delete2026-06-03
delete0
PRE
AI
J
Jingyuan Li
X
Xinyu Cai
Y
Yuan Dai
W
Wenbo Yin
王伶俐 封面图
王伶俐 (Lingli Wang)
DOI:10.1109/tvlsi.2026.3697086delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
人工智能(AI)的快速发展对硬件加速器提出了日益增长的需求,特别是在现代模型结合密集线性运算与不断增多的不规则、非线性及控制密集型算子时。尽管张量核心和脉动阵列能为规则计算提供高吞吐量,但它们通常难以高效支持近期模型结构中涌现的多样化操作。粗粒度可重构阵列(CGRAs)凭借其空间并行性和可重构性,可能成为此类异构工作负载中密集加速器的天然补充。在本文中,我们提出EUREKA,一种异构加速框架,通过统一指令集、跨架构数据调度、针对非线性算子的定制硬件支持以及指令级、任务级和算子级的优化来整合张量核心与CGRAs以利用并行性。在软件层面,我们引入一种分层编译策略,结合图级优化与张量级调度技术。为应对软硬件协同优化的巨大设计空间,我们进一步开发了一种基于贝叶斯优化的探索方案,并增强其核压缩方法,从而为识别有前景的硬件配置和调度策略提供高效手段。在代表性AI基准测试中的实验结果表明,EUREKA提升了执行效率,实现了平均12.6倍于当前最先进框架的归一化性能提升。
Keyword:
Accelerator
coarse-grained reconfigurable arrays (CGRAs)
compilation
neural networks

期刊

I
IEEE Transactions on Very Large Scale Integration (VLSI) Systems
IF:
3.1
论文数:
459
被引数:
7.3K

机构

F
fudan university
学者数:
11.8W
论文数: 7.7W
被引数: 121
引用论文

引用论文

暂无论文信息