arrow
返回

IOLM-DB: Instance-optimized large language model execution for column-scale semantic operators

delete2026-09-01
delete0
delete
OA
AI
B
Bardia Mohammadi *
L
Laurent Bindschaedler
DOI:10.1016/j.is.2026.102796delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大型语言模型(LLMs)可以对表格数据进行行级语义转换,但通用模型即使在每行使用固定提示时也会保留相同的加速器资源。IOLM-DB将这种重复出现的提示-列对编译为一个大小与其实际工作量相匹配的操作符。它对目标列进行采样,构建代表提示和输出行为的校准序列,评估专用候选方案,并在显式内存和质量约束下选择实现。在异构数据集和操作符类型中,列校准量化将参考模型的驻留占用空间减少1.8–2.8倍,同时8位配置文件仍保持近无损替换,4位配置文件在分类标签输出操作符上保持行为。在固定精度下,列校准始终比通用GPTQ校准提高保真度,而输出感知校准为生成型操作符提供了额外优势。部署实验揭示了两种互补结果:在计算资源丰富的环境下,仅权重压缩不会提高每行吞吐量,其主要作用是释放容量;但当内存带宽受限时,更小的权重流也能提高吞吐量。紧凑的成果使得在内存预算下部署成为可能,其中全精度操作符无法启动,并允许三个专用操作符占据约一个全精度模型的占用空间。因此,IOLM-DB将重复的语义转换从不可变的通用后端调用转变为紧凑、可测量且硬件感知的操作符。
Keyword:
Semantic operators
Tabular data
Large language models
Model compression
Quantization
Knowledge distillation
Instance optimization
Efficiency

期刊

I
Information Systems
IF:
3.4
论文数:
118
被引数:
0

机构

暂无机构信息