返回
Characterizing and Efficiently Accelerating Multimodal Generation Model Inference
DOI:10.1109/MM.2025.3596539.png)
摘要
En 中文
生成式人工智能(AI)技术正在改变计算行业,带来了新的系统设计和优化机会。特别是,AI在理解和响应多种模态方面的能力伴随着巨大的系统资源需求。为了可持续地将生成式AI能力扩展到全球数十亿用户,推理过程必须快速且高效。本文通过分析一组新兴的多模态生成模型在真实系统上的表现,指出了关键的系统设计和优化机会。自回归式令牌生成是延迟性能的关键瓶颈,通常由GPU空闲时间主导。除了生成式AI模型中内存密集型的注意力机制外,由于Transformer基模型中的前馈网络,线性运算构成了显著的推理延迟。我们证明,从应用到系统软件和硬件的当前最先进的优化手段,设定了一个提升3.88倍的更好基准。
Keyword:
Generative AI
Computational modeling
Translation
Artificial intelligence
Decoding
Graphics processing units
Codes
Vocoders
Transformers
Memory management

