Skip to main content
QUICK REVIEW

[论文解读] Vision Transformer with Attention Map Hallucination and FFN Compaction

Haiyang Xu, Zhichao Zhou|arXiv (Cornell University)|Jun 19, 2023
CCD and CMOS Imaging SensorsEngineering被引用 3
一句话总结

本文提出 hallucinated-MHSA (hMHSA) 和 compact-FFN (cFFN),通过利用注意力图和前馈网络中的冗余性来降低视觉 Transformer 的复杂度。hMHSA 通过廉价操作从另一半生成另一半的注意力图,避免了完整的 Q-K 相关性计算;cFFN 则利用矩阵分解和重参数化技术压缩 FFN,使 DeiT、NextViT 和 PVT 主干网络的 FLOPs 和参数量减少 10%-20%,同时保持了具有竞争力的准确率。

ABSTRACT

Vision Transformer(ViT) is now dominating many vision tasks. The drawback of quadratic complexity of its token-wise multi-head self-attention (MHSA), is extensively addressed via either token sparsification or dimension reduction (in spatial or channel). However, the therein redundancy of MHSA is usually overlooked and so is the feed-forward network (FFN). To this end, we propose attention map hallucination and FFN compaction to fill in the blank. Specifically, we observe similar attention maps exist in vanilla ViT and propose to hallucinate half of the attention maps from the rest with much cheaper operations, which is called hallucinated-MHSA (hMHSA). As for FFN, we factorize its hidden-to-output projection matrix and leverage the re-parameterization technique to strengthen its capability, making it compact-FFN (cFFN). With our proposed modules, a 10$\%$-20$\%$ reduction of floating point operations (FLOPs) and parameters (Params) is achieved for various ViT-based backbones, including straight (DeiT), hybrid (NextViT) and hierarchical (PVT) structures, meanwhile, the performances are quite competitive.

研究动机与目标

  • 解决视觉 Transformer 中多头自注意力(MHSA)和前馈网络(FFN)组件中被忽视的冗余性问题。
  • 在不牺牲模型性能的前提下,降低计算复杂度(FLOPs 和参数量)。
  • 探究 MHSA 中的注意力图是否具有相关性,能否通过“幻觉生成”而非完整计算来替代。
  • 通过矩阵分解和重参数化技术重新设计 FFN,以实现紧凑性,同时保持表征能力。
  • 在多种 ViT 架构(包括直线型 DeiT、混合型 NextViT 和分层型 PVT)上验证所提模块的有效性。

提出的方法

  • 提出 hallucinated-MHSA (hMHSA),通过更廉价的操作从另一半注意力图生成另一半,避免完整计算 Q-K 相关性。
  • 对 FFN 中的隐藏层到输出层投影矩阵进行矩阵分解,以抑制冗余并减少参数量。
  • 对分解后的 FFN 应用重参数化技术,使多个训练阶段分支在推理阶段合并为单次强前向传播。
  • 使用紧凑比 t 控制 cFFN 中的压缩程度,其中 t=2/3 被选为准确率-效率权衡的最优值。
  • 将 hMHSA 和 cFFN 应用于 DeiT、NextViT 和 PVTv2 等多种 ViT 主干网络,保持具有竞争力的性能表现。
  • 通过消融实验评估重参数化分支数(r)、不同矩阵上的分解(M1 与 M2)以及压缩比(t)的影响。

实验结果

研究问题

  • RQ1是否能通过更廉价的操作有效“幻觉生成”MHSA 中的冗余注意力图,而非完整计算?
  • RQ2对 FFN 投影矩阵进行矩阵分解是否能减少冗余,同时保持模型容量?
  • RQ3重参数化如何在不增加推理成本的前提下提升压缩 FFN 的性能?
  • RQ4在所提出的 cFFN 模块中,压缩比与准确率之间的最优平衡点是什么?
  • RQ5hMHSA 和 cFFN 是否能在包括直线型、混合型和分层型结构在内的多种 ViT 架构中有效泛化?

主要发现

  • hMHSA 通过从另一半生成另一半注意力图,实现了 MHSA 计算的减少,在性能损失极小的情况下显著降低了 FLOPs 和参数量。
  • 结合矩阵分解与重参数化的 cFFN 在多个 ViT 主干网络中实现了 10%-20% 的 FLOPs 和参数量减少,同时保持了具有竞争力的准确率。
  • 消融实验表明,对隐藏层到输出层投影矩阵(M2)进行分解的效果优于对输入层到隐藏层矩阵(M1)的分解,准确率提升 0.2%。
  • 在 cFFN 中使用 r=2 个重参数化分支在性能与训练成本之间实现了最佳权衡,优于 r=1 和 r=3。
  • 在 cFFN 中,最优压缩比 t=2/3 在 PVTv2-b1 上实现了 70.2% 的 top-1 准确率,当 FLOPs 和参数量与基线匹配时,性能优于基线 0.3%。
  • 在 CIFAR-100 和 Stanford-Dog 数据集上的迁移学习结果表明,所提模型的性能与原始模型相当或略有超越。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。