返回
An Efficient Layer Normalization Training Module With Dynamic Quantization for Transformers
DOI:10.1109/TCSII.2025.3591633.png)
摘要
En 中文
层归一化(LN)函数在基于Transformer的神经网络中得到了广泛应用。在个人设备上高效训练Transformer正因数据隐私和延迟问题而受到关注。然而,关键的LN函数涉及用于量化的极端离群值,以及硬件不友好的平方根和除法运算,这为边缘端训练部署带来了资源挑战。本文提出了一种高效的LN训练架构,实现了算法与硬件的协同优化。具体而言,我们提出了一种基于整数运算的动态量化算法,以平滑离群值,确保训练精度。随后,我们开发了一种可重构硬件架构,以高效支持LN训练中的各种运算,并通过逐向量流水线数据流进一步提高硬件效率。实验结果表明,我们的架构在FPGA和ASIC平台上分别实现了高达0.25和1.0 Giga输入每秒(GinS)的吞吐量,优于现有工作。
Keyword:
Transformer
training
softmax
activation function
architecture
algorithm
期刊
I
IF:
4.9
论文数:
8.8K
被引数:
2.5W
机构
引用论文
Hardware-oriented algorithms for softmax and layer normalization of large language models面向硬件的大型语言模型的softmax和层规范化算法
Normalization Techniques in Training DNNs: Methodology, Analysis and Application训练dnn中的归一化技术: 方法,分析和应用

