arrow
返回

A Custom Hardware Accelerator for Softmax Function With Parallel Online Normalization

delete2026-07-09
delete0
PRE
AI
S
Shareefa Fairoose P.
A
Ashutosh Mishra
DOI:10.1109/tvlsi.2026.3706101delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
基于Transformer的LLM/SLM模型中的Softmax计算通常依赖在线归一化以确保数值稳定性并减少内存访问周期。然而,传统的在线公式引入了循环依赖,导致串行化,限制了可扩展的空间并行性和硬件实现中高效的宽数据路径实现。本文提出了一种基于算法-架构协同设计的并行在线归一化框架的自定义Softmax硬件加速器(CSHA)。所提出的算法将顺序在线归一化重新表述为并行流兼容结构,同时保持数值稳定性和内存效率,从而实现可扩展的数据路径并行性。所有核心计算单元——最大值检测、指数近似、归约树、乘法和日志计算——均经过电路优化并在90 nm CMOS工艺中综合,以评估面积、功耗和延迟的权衡。CSHA采用一种完全流水化的定点架构,专为精度感知的硬件效率设计。系统级验证通过将预训练BERT模型中的浮点Softmax替换为所提出的实现,在GLUE任务和SQuAD数据集上展示了低于1%的精度下降。在Zynq-7000 SoC上的现场可编程门阵列(FPGA)部署进一步验证了功能正确性和动态序列长度可配置性,消除了冗余填充Softmax计算。通过集成算法重构与电路级优化,所提出的CSHA提供了一种高效且可扩展的Softmax解决方案,适用于低功耗、高吞吐量的推理系统。
Keyword:
Custom Softmax hardware accelerator (CSHA)
edge devices
field programmable gate arrays (FPGA)
IP core
LLM
on-chip MaxFinder
parallel online normalization
pipelining
SLM

期刊

I
IEEE Transactions on Very Large Scale Integration (VLSI) Systems
IF:
3.1
论文数:
459
被引数:
7.3K

机构

G
government engineering college wayanad
学者数:
2
论文数: 2
被引数: 0
N
National Institute of Technology Calicut
学者数:
999
论文数: 804
被引数: 1.4K