返回
Fractal-Guided Token Pruning for Efficient Vision Transformers
DOI:10.3390/fractalfract9120767.png)
摘要
En 中文
视觉Transformer在计算机视觉任务中表现出色,但与token数量相关的计算复杂度为二次方,限制了其在资源受限环境中的部署。现有的token剪枝方法依赖注意力分数来识别重要token,但注意力机制捕获的是查询相关的相关性而非内在信息内容,可能丢弃对后续层或不同下游任务有用的token。我们提出了一种分形引导的token剪枝方法,该方法利用token嵌入的相关维度Dcorr作为几何复杂度的任务无关度量。我们的核心见解是,高Dcorr的token在表示空间中跨越高维流形,表明复杂模式,而低Dcorr的token则坍缩为表示冗余信息的简单结构。通过计算每个token的局部Dcorr并剪枝值最低的token,我们的方法保留了与注意力相关性无关的几何复杂token。相关维度量化了token嵌入如何填充表示空间:来自均匀背景区域的嵌入在低维子空间中紧密聚集(低Dcorr),而来自复杂纹理或物体边界的嵌入则分布在更高维的流形上(高Dcorr),反映其更丰富的信息内容。在CIFAR-10和CIFAR-100上对微调后的ViT-B/16模型进行的实验表明,分形引导剪枝在所有测试比率下均优于随机剪枝和范数基剪枝。在40%剪枝率下,分形剪枝在CIFAR-10上保持92.26%的准确率,仅比93.25%的基线下降0.99个百分点,同时实现1.17×的加速。我们的方法提供了一种基于几何学的token重要性标准,补充了基于注意力的方法,并在CIFAR-10和CIFAR-100数据集之间显示出良好的泛化能力。
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
3.3
论文数:
4.3K
被引数:
7.6K
机构
引用论文
Automatic pruning rate adjustment for dynamic token reduction in vision transformervision transformer中用于动态令牌减少的自动修剪速率调整
APPLIED INTELLIGENCE
IF3.5

