arrow
返回

Reducing LLM Inference Memory Bandwidth via Frequent Exponent Value Encoding

delete2026-01-01
delete0
PRE
AI
M
Maxwell Michalec *
S
Swamit Tannu
G
Gurindar S. Sohi
DOI:10.1109/LCA.2026.3671166delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
我们研究了将大语言模型(LLM)权重在内存和处理器(CPU或GPU)之间传输所需的内存带宽问题。观察到FP8和BF16浮点格式中少数指数值占主导地位,我们提出了一种替代(压缩)的指数表示和存储方式,以及一种在处理器中重建完整精确权重值的设计。该方法在保持原始LLM推理软件计算不变的情况下,分别将使用FP8和BF16格式权重的LLM所需内存带宽减少了高达10%和30%。
Keyword:
Tensors
Random access memory
Encoding
Decoding
Codes
Software
Computational modeling
Metadata
Entropy
Bandwidth
Artificial intelligence
data compaction and compression
language models

期刊

I
IEEE Computer Architecture Letters
IF:
1.4
论文数:
42
被引数:
781

机构

University of Wisconsin System 封面图
University of Wisconsin System
学者数:
6.7W
论文数: 5.8W
被引数: 382
引用论文

引用论文

SLO-Aware GPU DVFS for Energy-Efficient LLM Inference Serving
err2024-07-01
err0
PREAI
errKakolyris,Andreas Kosmas; Masouros,Dimosthenis; Xydis,Sotirios; Soudris,Dimitrios
err分享
err收藏
Mind the Memory Gap: Unveiling GPU Bottlenecks in Large-Batch LLM Inference
err2025-07-07
err0
PREAI
errRecasens,Pol G.; Agullo,Ferran; Zhu,Yue; Wang,Chen; Lee,Eun Kyung; Tardieu,Olivier; Torres,Jordi; Berral,Josep Ll.
err分享
err收藏
ZipNN: Lossless Compression for AI Models
err2025-07-07
err0
PREAI
errHershcovitch,Moshik; Wood,Andrew; Choshen,Leshem; Girmonsky,Guy; Leibovitz,Roy; Ozeri,Or; Ennmouri,Ilias; Malka,Michal; Chin,Peter; Sundararaman,Swaminathan; Harnik,Danny
err分享
err收藏