返回
Reducing LLM Inference Memory Bandwidth via Frequent Exponent Value Encoding
DOI:10.1109/LCA.2026.3671166.png)
摘要
En 中文
我们研究了将大语言模型(LLM)权重在内存和处理器(CPU或GPU)之间传输所需的内存带宽问题。观察到FP8和BF16浮点格式中少数指数值占主导地位,我们提出了一种替代(压缩)的指数表示和存储方式,以及一种在处理器中重建完整精确权重值的设计。该方法在保持原始LLM推理软件计算不变的情况下,分别将使用FP8和BF16格式权重的LLM所需内存带宽减少了高达10%和30%。
Keyword:
Tensors
Random access memory
Encoding
Decoding
Codes
Software
Computational modeling
Metadata
Entropy
Bandwidth
Artificial intelligence
data compaction and compression
language models
期刊
I
IF:
1.4
论文数:
42
被引数:
781


