返回
Database Perspective on LLM Inference Systems
DOI:10.14778/3750601.3750703.png)
摘要
En 中文
大型语言模型(LLMs)正在推动新一波基于语言的应用,包括数据库应用,从而催生了用于处理LLMs巨大计算和内存需求的新技术和系统,这些技术与计算硬件的进步相结合。在本教程中,我们回顾了这些技术如何通过管理不确定的请求生命周期、利用专用硬件以及在分布式推理设备和机器上进行扩展来降低推理成本。我们从数据库视角,从请求处理、模型执行与优化以及内存管理的角度介绍了这些技术。在这些讨论之后,我们回顾了推理系统如何在多样化的架构中结合这些技术,以实现应用或性能目标。
期刊
P
IF:
3.3
论文数:
563
被引数:
1.2W

