返回
An efficient quantized GEMV implementation for large language models inference with matrix core
DOI:10.1007/s11227-025-06993-6.png)
摘要
En 中文
大型语言模型(LLMs)的显著优势引发了在设备上部署和利用这些模型的广泛关注。然而,LLMs中过多的参数导致推理过程中产生巨大的内存占用和计算负担,严重限制了LLMs的潜在应用。作为一种有效的模型压缩方法,量化压缩可以降低LLMs的部署和推理门槛。在此过程中,量化的通用矩阵-向量乘法(GEMV)是推理过程中的主要运行时组件。在实际应用中,反量化过程和低计算密度限制了量化GEMV的性能。本文提出了一种高效的量化GEMV实现方案,包括向量化预取策略、基于Matrix Core的高效内核设计以及atomicAdd的优化,以加速LLMs的推理。最后,在MI210上进行了各种对比实验。实验结果表明,所提出的方法在多种形状的量化GEMV以及LLMs的端到端推理中均优于现有方法。
Keyword:
GPU
LLMs
Quantized GEMV
Matrix core
期刊
IF:
2.7
论文数:
1.1K
被引数:
1.0W
机构
暂无机构信息
引用论文
Automatic Kernel Generation for Large Language Models on Deep Learning Accelerators深度学习加速器上针对大型语言模型的自动核函数生成

