返回
Concatenation-based positional encoding for transformer models: proposal and performance analysis
DOI:10.5351/KJAS.2026.39.2.179.png)
摘要
En 中文
尽管Transformer模型在各个领域取得了成功,但由于其排列不变的注意力机制忽略了位置依赖关系,因此在时间序列预测中面临挑战。传统的位置编码缓解了这一问题,但其对输入嵌入的逐元素相加往往导致语义信息和位置信息之间的干扰。本研究探讨了基于拼接的位置编码在结构与理论特性上与基于相加的常规方法之间的差异。通过分析注意力得分公式,我们发现拼接式编码使语义和位置分量能够在独立的子空间中处理,从而在注意力机制中引入不同的归纳偏置。进一步采用注意力图可视化,定性考察了不同编码结构下位置信息的反映方式,为可解释性提供了见解。在时间序列预测和自然语言处理任务上进行了实证评估,以检验性能和可解释性。结果显示,拼接式位置编码相比相加式方法在两个任务领域中均取得更优性能,特别是在位置信息起关键作用的情况下增益更为显著。通过对结构行为和任务依赖效应的系统分析,本研究有助于更清晰地理解Transformer模型中位置信息的处理方式。
Keyword:
transformer models
positional encoding
concatenation
期刊
K
IF:
0
论文数:
20
被引数:
0
机构
引用论文
暂无论文信息

