返回
AMAP: Automatic Multihead Attention Pruning by Similarity-Based Pruning Indicator
DOI:10.1109/TNNLS.2025.3606750.png)
摘要
En 中文
尽管Transformer表现出色,但自注意力机制的二次计算复杂度给其在视觉任务中的应用带来了挑战。线性注意力将此复杂度从二次降低到线性,提供了强大的计算-性能权衡。为进一步优化,自动剪枝是一种有效方法,可通过训练寻找在目标资源内最大化性能的结构,且无需启发式方法。然而,直接将其应用于多头注意力因通道不匹配而并非易事。本文提出了一种自动剪枝方法以解决此问题。与仅依赖训练且无先验知识的方法不同,我们将基于通道相似性的权重整合到剪枝指标中,以保留每个头中信息量更丰富的通道。随后,我们调整剪枝指标,强制通道在所有头中均匀移除,从而避免通道不匹配。我们引入一个重加权模块以缓解因通道移除导致的信息损失,并针对线性注意力提出一种有效的剪枝指标初始化方法,该方法基于原始结构与各通道间的注意力差异。通过将我们的剪枝方法应用于包含原始及线性注意力机制的FLattenTransformer并在ImageNet-1K上测试,我们在近乎无损的情况下实现了30%的FLOPs减少。该方法相较于DeiT-B模型,在FLOPs减少37%的同时提升了1.96%的准确率;相较于Swin-B模型,在FLOPs减少10%的同时提升了1.05%的准确率。所提方法在性能上超越了现有的高效模型及近期提出的剪枝方法。
Keyword:
Automatic pruning
efficient network
linear attention
multihead self-attention
network pruning
transformer
期刊
IF:
8.9
论文数:
7.6K
被引数:
7.2W
机构
引用论文
Training-Free Transformer Architecture Search With Zero-Cost Proxy Guided Evolution无训练的Transformer架构搜索:基于零成本代理引导的进化
Multidimensional Pruning and Its Extension: A Unified Framework for Model Compression多维剪枝及其扩展: 一个统一的模型压缩框架

