arrow
Return

SEMQ: Efficient non-uniform quantization with sensitivity-based error minimization for large language models

delete2025-09-05
delete0
PRE
AI
D
Dongmin Li
X
Xiurui Xie
D
Dongyang Zhang
A
Athanasios V. Vasilakos
M
Man-Fai Leung
DOI:10.1016/j.future.2025.108120delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
• A novel non-uniform quantization algorithm designed for Large Language Models (LLMs), featuring an iterative optimization strategy for quantization point selection that effectively minimizes quantization errors. • We approximate LLM weight distributions to bell-shaped curves, coupled with a robust outlier detection and separation mechanism, thereby enhancing quantization resilience. • Conducting a comprehensive empirical evaluation on a series of benchmark datasets, demonstrating the algorithm’s efficacy in achieving 2-bit quantization while preserving competitive model performance.

Journal

F
Future Generation Computer Systems
IF:
0
Papers:
642
Citations:
0

Organization

U
university of electronic science and technology of china
Scholars:
1.2W
Papers: 4.4K
Citations: 4
I
iau
Scholars:
3
Papers: 4
Citations: 0
A
Anglia Ruskin University
Scholars:
2.5K
Papers: 2.5K
Citations: 3.3K
researcher View more organizations