返回
Word embedding factor based multi-head attention
DOI:10.1007/s10462-025-11115-y.png)
摘要
En 中文
自然语言处理(NLP)领域通过使用基于多头注意力机制(如Transformer和BERT)的深度学习模型取得了显著进展。然而,这种方法存在两大主要局限性:首先,注意力头的数量通常基于经验手动设定;其次,其在语义理解和解释方面不够清晰。本研究提出了一种新颖的注意力机制,称为基于因子分析的多头(FAM)注意力,该机制结合了探索性因子分析理论和词嵌入。实验结果表明,与传统方法相比,FAM注意力在实现更好性能的同时所需参数更少,并且在词元级别具有更强的语义理解和可解释性。这对当前的大语言模型(LLMs)具有重要意义,特别是在有效减少参数数量和提升性能方面。
Keyword:
Multi-head attention
Word embedding
Factor analysis
BERT
期刊
IF:
13.9
论文数:
6.1K
被引数:
1.9W
机构
引用论文
The Biases of Pre-Trained Language Models: An Empirical Study on Prompt-Based Sentiment Analysis and Emotion Detection预训练语言模型的偏差: 基于提示的情感分析和情感检测的实证研究
Seformer: a long sequence time-series forecasting model based on binary position encoding and information transfer regularization
APPLIED INTELLIGENCE
IF3.5

