arrow
返回

APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration

delete2026-04-01
delete0
PRE
AI
S
Shaobo Ma
C
Chao Fang *
H
Haikuo Shao
Z
Zhongfeng Wang *
DOI:10.1109/TCAD.2025.3604321delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大型语言模型(LLMs)已革新AI应用,但其巨大的计算需求严重限制了部署和实时性能。量化方法可帮助降低计算成本;然而,在任意精度下实现与超低位量化LLMs相关联的极端效率,对GPU构成挑战。这主要源于GPU张量核心(TCs)支持有限、内存管理效率低下及内核优化不灵活。为应对这些挑战,我们提出了一种针对任意精度LLMs的综合加速方案,即APT-LLM。首先,我们引入了一种新型数据格式——双极-INT,它允许与有符号INT高效无损转换,同时更利于并行计算。我们还开发了一种矩阵乘法(MatMul)方法,通过在位级拆解和重组矩阵实现任意精度,该方法提供灵活精度并优化GPU TCs利用率。此外,我们提出了一种以数据恢复为重点的内存管理系统,该系统策略性地采用快速共享内存,显著提升内核执行速度并降低内存访问延迟。最后,我们开发了一种内核映射方法,动态选择不同矩阵尺寸下内核的最优可配置超参数,使不同LLM架构和精度设置下均能实现最佳性能。在LLM推理中,APT-LLM相较于FP16基线最高实现3.99倍加速,相较于NVIDIA CUTLASS INT4加速在RTX 3090上实现2.16倍加速。在RTX 4090和H800上,APT-LLM相较于FP16最高实现2.44倍加速,相较于CUTLASS整数基线实现1.65倍加速。
Keyword:
Graphics processing units
Kernel
Quantization (signal)
Memory management
Computational modeling
Tensors
Optimization
Computational efficiency
Parallel processing
Instruction sets
AI accelerators
deep learning
edge AI
generative pre-trainer transformer
scheduling algorithms

期刊

I
IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems
IF:
2.9
论文数:
668
被引数:
9.6K

机构

N
nanjing university
学者数:
7.8W
论文数: 5.6W
被引数: 87
引用论文

引用论文

NVIDIA A100 Tensor Core GPU: Performance and Innovation
err2021-03-01
err0
PREAI
errJack Choquette; Wishwesh Gandhi; Olivier Giroux; Nick Stam; Ronny Krashinsky
err分享
err收藏
GTCO: Graph and Tensor Co-Design for Transformer-Based Image Recognition on Tensor Cores
err
IF0
err2024-02-01
err0
PREAI
errYang Bai; Xufeng Yao; Qi Sun; Wenqian Zhao; Shixin Chen; Zixiao Wang; Bei Yu
err分享
err收藏
QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs
err2024-01-01
err0
PREAI
errAlistarh,Dan; Ashkboos,Saleh; Cameron,Pashmina; Croci,Maximilian; Hensman,James; Hoefler,Torsten; Jaggi,Martin; Li,Bo; Mohtashami,Amirkeivan
err分享
err收藏
O3BNN-R: An Out-of-Order Architecture for High-Performance and Regularized BNN Inference
err2021-01-01
err34
errOAAI
errGeng, Tong; Li, Ang; Wang, Tianqi; Wu, Chunshu; Li, Yanfei; Shi, Runbin; Wu, Wei; Herbordt, Martin
err分享
err收藏
学者 查看更多内容