[论文解读] EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm
该论文提出EATFormer,一种受进化算法(EA)启发的视觉Transformer架构,引入基于进化算法的Transformer模块(EAT),包含多尺度区域聚合(MSRA)、全局与局部交互(GLI)以及前馈网络(FFN)模块,以建模多尺度、交互式及个体化特征。在使用基础模型(4900万参数)的情况下,EATFormer在ImageNet-1K上实现了83.9%的Top-1准确率,达到SOTA性能,并在COCO目标检测和ADE20K语义分割任务中以更少的FLOPs超越SOTA方法。
Motivated by biological evolution, this paper explains the rationality of Vision Transformer by analogy with the proven practical evolutionary algorithm (EA) and derives that both have consistent mathematical formulation. Then inspired by effective EA variants, we propose a novel pyramid EATFormer backbone that only contains the proposed EA-based transformer (EAT) block, which consists of three residual parts, i.e., Multi-scale region aggregation, global and local interaction, and feed-forward network modules, to model multi-scale, interactive, and individual information separately. Moreover, we design a task-related head docked with transformer backbone to complete final information fusion more flexibly and improve a modulated deformable MSA to dynamically model irregular locations. Massive quantitative and quantitative experiments on image classification, downstream tasks, and explanatory experiments demonstrate the effectiveness and superiority of our approach over state-of-the-art methods. E.g., our Mobile (1.8 M), Tiny (6.1 M), Small (24.3 M), and Base (49.0 M) models achieve 69.4, 78.4, 83.1, and 83.9 Top-1 only trained on ImageNet-1K with naive training recipe; EATFormer-Tiny/Small/Base armed Mask-R-CNN obtain 45.4/47.4/49.0 box AP and 41.4/42.9/44.2 mask AP on COCO detection, surpassing contemporary MPViT-T, Swin-T, and Swin-S by 0.6/1.4/0.5 box AP and 0.4/1.3/0.9 mask AP separately with less FLOPs; Our EATFormer-Small/Base achieve 47.3/49.3 mIoU on ADE20K by Upernet that exceeds Swin-T/S by 2.8/1.7. Code is available at https://github.com/zhangzjn/EATFormer.
研究动机与目标
- 通过与已验证的进化算法(EA)类比,解释视觉Transformer的合理性,揭示EA算子与自注意力/FFN组件之间的共享数学公式。
- 通过整合强调全局与局部种群建模的有效EA变体,改进视觉Transformer,以增强特征表示能力。
- 设计一种新颖的基于金字塔结构的EATFormer主干网络,完全由所提出的EAT模块构成,实现多尺度、交互式与个体化特征建模。
- 引入任务相关头(TRH),实现灵活的最终特征融合;并设计调制可变形多头自注意力(MD-MSA),以实现对不规则空间位置的动态建模。
- 在图像分类、目标检测与语义分割任务中展示卓越的性能与效率,并通过消融实验与可视化分析验证设计选择的有效性。
提出的方法
- 推导视觉Transformer中多头自注意力(MSA)与进化算法中交叉算子之间的数学等价性,以及前馈网络(FFN)与突变算子之间的数学等价性。
- 提出EAT模块,作为集成三部分的残差架构:多尺度区域聚合(MSRA)用于多尺度特征提取,全局与局部交互(GLI)用于并行的全局与局部建模,FFN用于个体特征增强。
- 引入任务相关头(TRH)模块,通过交叉注意力机制与Transformer主干网络对接,实现灵活、任务特定的信息融合。
- 设计调制可变形多头自注意力(MD-MSA),学习动态采样偏移量与调制权重,实现对不规则空间配置的自适应注意力。
- 在ImageNet-1K上应用朴素训练方案评估EATFormer主干网络性能,并通过消融实验分析GLI、MD-MSA与TRH模块的贡献。
- 在图像分类、COCO目标检测与ADE20K语义分割任务上开展广泛实验,包括注意力可视化与FLOPs/参数量分布分析。
实验结果
研究问题
- RQ1视觉Transformer的结构组件能否与进化算法算子(如交叉与突变)建立正式关联?
- RQ2从EA变体中引入全局与局部种群建模机制,如何提升视觉Transformer中的特征表示能力?
- RQ3所提出的EAT模块(含MSRA、GLI与FFN)在多尺度与交互式特征学习方面,相较于标准ViT模块,提升程度如何?
- RQ4与标准分类头相比,任务相关头(TRH)在最终特征融合方面有何改进?
- RQ5MD-MSA模块是否能比标准MSA更有效地动态建模不规则空间位置?其在密集预测任务上的性能影响如何?
主要发现
- EATFormer-Base在ImageNet-1K上以仅4900万参数实现83.9%的Top-1准确率,在相同训练方案下超越SOTA方法。
- EATFormer-Tiny、Small与Base分别实现78.4%、83.1%与83.9%的Top-1准确率,即使在小模型尺寸下也表现出强劲性能。
- 在COCO目标检测任务中,EATFormer-Tiny/Small/Base分别取得45.4/47.4/49.0的框AP与41.4/42.9/44.2的掩码AP,较Swin-T/S高出0.6/1.4/0.5 AP,较MPViT-T高出0.4/1.3/0.9 AP,且FLOPs更少。
- 在ADE20K语义分割任务中,EATFormer-Small/Base分别取得47.3/49.3的mIoU(使用UperNet),较Swin-T/S高出2.8/1.7 mIoU。
- 可视化结果表明,GLI增强了对更广阔区域的关注,尤其在最后阶段,有效缓解了缺乏局部建模模型中对稀疏区域的过度集中现象。
- 参数量与FLOPs分析显示,FFN主导了参数量,而早期阶段贡献了最多的FLOPs,表明FFN与早期层具有显著的优化潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。