arrow
返回

Small Transformer Architectures for Task Switching

delete2026-01-01
delete0
PRE
AI
C
Claudius Gros *
DOI:10.1007/978-3-032-04558-4_10delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大规模生成式AI的快速进展在很大程度上基于注意力机制。然而,构想出能超越传统方法(如多层感知器或循环网络)的小规模应用并非易事。我们在“任务切换”的背景下考察了这一问题。在此框架中,模型处理持续进行的标记序列,当前任务由随机插入的控制标记决定。我们证明,标准Transformer无法解决一个基于有限域算术的基本任务切换参考模型,该模型包含专门用于增量/加法/反向复制/上下文(IARC)的子任务。我们表明,Transformer、长短期记忆循环网络(LSTM)和纯多层感知器(MLP)实现了相似的,但仅适度的预测精度。我们通过纳入标准Transformer架构的扩展版本(其非平移不变对应物cisformer)和一种替代注意力机制(扩展注意力)来扩展我们的比较研究。发现后者的组合是唯一能够达到约95%显著性能水平的模型。我们的结果表明,在任务切换设置中比较定性不同的表述,可以更好地理解并改进注意力的工作机制。
Keyword:
attention
transformer
task-switching

期刊

A
ARTIFICIAL NEURAL NETWORKS AND MACHINE LEARNING-ICANN 2025, PT I
IF:
0
论文数:
53
被引数:
0

机构

G
goethe university frankfurt
学者数:
2.6K
论文数: 1.0K
被引数: 0
引用论文

引用论文

Lost in the Middle: How Language Models Use Long Contexts迷失在中间: 语言模型如何使用长上下文
err2024-02-23
err56
errOAAI
errLiu, Nelson F.; Lin, Kevin; Hewitt, John; Paranjape, Ashwin; Bevilacqua, Michele; Petroni, Fabio; Liang, Percy
err分享
err收藏
err分享
err收藏
err分享
err收藏
When Federated Learning Meets Privacy-Preserving Computation当联合学习满足隐私保护计算时
err2024-10-03
err8
PREAI
errChen, Jingxue; Yan, Hang; Liu, Zhiyuan; Zhang, Min; Xiong, Hu; Yu, Shui
err分享
err收藏
err分享
err收藏
err分享
err收藏
What Formal Languages Can Transformers Express? A Survey
err2024-05-07
err3
errOAAI
errStrobl, Lena; Merrill, William; Weiss, Gail; Chiang, David; Angluin, Dana
err分享
err收藏
没有更多内容