返回
APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
DOI:10.1109/TCAD.2025.3604321.png)
摘要
En 中文
大型语言模型(LLMs)已革新AI应用,但其巨大的计算需求严重限制了部署和实时性能。量化方法可帮助降低计算成本;然而,在任意精度下实现与超低位量化LLMs相关联的极端效率,对GPU构成挑战。这主要源于GPU张量核心(TCs)支持有限、内存管理效率低下及内核优化不灵活。为应对这些挑战,我们提出了一种针对任意精度LLMs的综合加速方案,即APT-LLM。首先,我们引入了一种新型数据格式——双极-INT,它允许与有符号INT高效无损转换,同时更利于并行计算。我们还开发了一种矩阵乘法(MatMul)方法,通过在位级拆解和重组矩阵实现任意精度,该方法提供灵活精度并优化GPU TCs利用率。此外,我们提出了一种以数据恢复为重点的内存管理系统,该系统策略性地采用快速共享内存,显著提升内核执行速度并降低内存访问延迟。最后,我们开发了一种内核映射方法,动态选择不同矩阵尺寸下内核的最优可配置超参数,使不同LLM架构和精度设置下均能实现最佳性能。在LLM推理中,APT-LLM相较于FP16基线最高实现3.99倍加速,相较于NVIDIA CUTLASS INT4加速在RTX 3090上实现2.16倍加速。在RTX 4090和H800上,APT-LLM相较于FP16最高实现2.44倍加速,相较于CUTLASS整数基线实现1.65倍加速。
Keyword:
Graphics processing units
Kernel
Quantization (signal)
Memory management
Computational modeling
Tensors
Optimization
Computational efficiency
Parallel processing
Instruction sets
AI accelerators
deep learning
edge AI
generative pre-trainer transformer
scheduling algorithms
期刊
I
IF:
2.9
论文数:
668
被引数:
9.6K
机构
引用论文
Reducing shared memory footprint to leverage high throughput on Tensor Cores and its flexible API extension library通过减少共享内存占用以利用张量核心的高吞吐量及其灵活的API扩展库

