[论文解读] SG-Former: Self-guided Transformer with Evolving Token Reallocation
SG-Former 提出一种自引导的 Transformer 架构,通过动态演变的 token 重分配机制,自适应地将更多 token 分配给显著图像区域,以实现细粒度注意力,同时减少在不重要区域的 token 数量,从而在保持全局上下文和效率的同时实现优化。通过使用在训练过程中动态演化的多尺度自注意力机制生成的显著性图,该方法在更低的 FLOPs 和更少参数下实现了当前最优性能,在 ImageNet-1K 上达到 84.7% 的 Top-1 准确率,并在 ADE20K 上较 Swin Transformer 提升 +1.3% 准确率和 +3 mIoU。
Vision Transformer has demonstrated impressive success across various vision tasks. However, its heavy computation cost, which grows quadratically with respect to the token sequence length, largely limits its power in handling large feature maps. To alleviate the computation cost, previous works rely on either fine-grained self-attentions restricted to local small regions, or global self-attentions but to shorten the sequence length resulting in coarse granularity. In this paper, we propose a novel model, termed as Self-guided Transformer~(SG-Former), towards effective global self-attention with adaptive fine granularity. At the heart of our approach is to utilize a significance map, which is estimated through hybrid-scale self-attention and evolves itself during training, to reallocate tokens based on the significance of each region. Intuitively, we assign more tokens to the salient regions for achieving fine-grained attention, while allocating fewer tokens to the minor regions in exchange for efficiency and global receptive fields. The proposed SG-Former achieves performance superior to state of the art: our base size model achieves extbf{84.7\%} Top-1 accuracy on ImageNet-1K, extbf{51.2mAP} bbAP on CoCo, extbf{52.7mIoU} on ADE20K surpassing the Swin Transformer by extbf{+1.3\% / +2.7 mAP/ +3 mIoU}, with lower computation costs and fewer parameters. The code is available at \href{https://github.com/OliverRensu/SG-Former}{https://github.com/OliverRensu/SG-Former}
研究动机与目标
- 为解决 Vision Transformers 在高分辨率特征图中计算复杂度呈二次增长的问题。
- 在不牺牲全局感受野或增加计算成本的前提下,实现细粒度的全局自注意力机制。
- 基于区域显著性动态重分配 token,提升显著区域的表征质量。
- 通过端到端学习显著性图,减少对人工设计 token 聚合策略的依赖。
- 在单一自注意力机制中统一局部与全局注意力,实现自适应粒度。
提出的方法
- 模型使用多尺度自注意力机制,在单层内提取多粒度特征,通过分组注意力头捕捉局部与全局模式。
- 从多尺度自注意力输出中估计显著性图,以基于重要性识别显著图像区域。
- 根据显著性图重分配 token:显著区域分配更多 token 以实现细粒度交互,背景区域分配更少 token 以提升效率。
- 显著性图在训练过程中动态演化,实现自引导、自适应的 token 重分配,具有图像特定性和数据驱动特性。
- 关键和值 token 被重分配,而查询 token 保持不变,从而实现具有动态 token 分布的高效全局自注意力。
- 该方法在保持整个特征图长程依赖性的同时,将计算资源集中于语义重要区域。
实验结果
研究问题
- RQ1自注意力机制能否通过动态重分配 token 至显著区域,在保持全局上下文的同时提升细粒度表征质量?
- RQ2多尺度自注意力如何提升显著性图估计的准确性,以支持更优的 token 重分配?
- RQ3自引导、动态演化的 token 重分配是否在准确率和效率上优于固定或均匀的 token 聚合策略?
- RQ4自适应 token 分配能否在保持全局感受野的同时降低高分辨率特征图中的计算成本?
- RQ5基于局部、全局或混合尺度自注意力生成的显著性图对模型性能有何影响?
主要发现
- SG-Former 在 ImageNet-1K 上达到 84.7% 的 Top-1 准确率,较 Swin Transformer 提升 +1.3%。
- 在 COCO 目标检测任务中,SG-Former 达到 51.2 mAP bbAP,较 Swin Transformer 提升 +2.7 mAP。
- 在 ADE20K 语义分割任务中,SG-Former 达到 52.7 mIoU,较 Swin Transformer 提升 +3 mIoU。
- 使用基础模型时,SG-Former 在性能提升的同时,相比 Swin Transformer 显著降低了 FLOPs 和参数量。
- 消融实验证明,多尺度显著性图在 Top-1 准确率上优于局部、全局或人工定义的显著性图,提升 +0.9。
- 结合语义 FPN 后,SG-Former 在 ADE20K 上达到 50.6 mIoU,较 Swin Transformer 提升 4.6 mIoU,且参数量减少 10%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。