arrow
返回

Characterizing and Efficiently Accelerating Multimodal Generation Model Inference

delete2025-08-08
delete0
PRE
AI
Y
Yejin Lee
A
Alicia Golden
A
Anna Sun
B
Basil Hosmer
B
Bilge Acun
C
Can Balioglu
C
Changhan Wang
C
Charles David Hernandez
C
Christian Puhrsch
D
Daniel Haziza
D
Driss Guessous
F
Francisco Massa
J
Jacob Kahn
J
Jeffrey K. S. Wan
J
Jeremy Reizenstein
J
Jiaqi Zhai
J
Joe Isaacson
J
Joel Schlosser
J
Juan Pino
K
Kaushik Ram Sadagopan
L
Leonid Shamis
L
Linjian Ma
M
Min-Jae Hwang
M
Mingda Chen
M
Mostafa Elhoushi
P
Pedro Rodríguez
R
Ram Pasunuru
S
Samuel Hsia
S
Scott Yih
S
Sravya Popuri
X
Xing Liu
C
Carole-Jean Wu
DOI:10.1109/MM.2025.3596539delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
生成式人工智能(AI)技术正在改变计算行业,带来了新的系统设计和优化机会。特别是,AI在理解和响应多种模态方面的能力伴随着巨大的系统资源需求。为了可持续地将生成式AI能力扩展到全球数十亿用户,推理过程必须快速且高效。本文通过分析一组新兴的多模态生成模型在真实系统上的表现,指出了关键的系统设计和优化机会。自回归式令牌生成是延迟性能的关键瓶颈,通常由GPU空闲时间主导。除了生成式AI模型中内存密集型的注意力机制外,由于Transformer基模型中的前馈网络,线性运算构成了显著的推理延迟。我们证明,从应用到系统软件和硬件的当前最先进的优化手段,设定了一个提升3.88倍的更好基准。
Keyword:
Generative AI
Computational modeling
Translation
Artificial intelligence
Decoding
Graphics processing units
Codes
Vocoders
Transformers
Memory management

期刊

IEEE Micro 封面图
IEEE Micro
IF:
2.9
论文数:
127
被引数:
2.7K

机构

M
meta, bellevue, wa, usa
学者数:
1
论文数: 1
被引数: 0
M
meta, toronto, on, canada
学者数:
1
论文数: 1
被引数: 0
M
meta, seattle, wa, usa
学者数:
5
论文数: 1
被引数: 0
M
meta, menlo park, ca, usa
学者数:
16
论文数: 4
被引数: 0
M
meta, paris, france
学者数:
2
论文数: 1
被引数: 0
M
meta, cambridge, ma, usa
学者数:
2
论文数: 1
被引数: 0
M
meta, san francisco, ca, usa
学者数:
2
论文数: 2
被引数: 0
M
meta, new york, ny, usa
学者数:
6
论文数: 1
被引数: 0
M
meta, london, u.k.
学者数:
1
论文数: 1
被引数: 0
学者 查看更多机构
引用论文

引用论文

暂无论文信息