Skip to main content
QUICK REVIEW

[論文レビュー] EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm

Jiangning Zhang, Xiangtai Li|arXiv (Cornell University)|Jun 19, 2022
CCD and CMOS Imaging Sensors被引用数 15
ひとこと要約

本稿では、進化的計算(EA)をインspirationとするビジョントランスフォーマー・アーキテクチャ、EATFormerを提案する。EAに基づくトランスフォーマー・ブロック(EAT)を導入し、マルチスケール・リージョンアグリゲーション(MSRA)、グローバル・ローカル相互作用(GLI)、およびフィードフォワードネットワーク(FFN)モジュールを組み合わせることで、マルチスケールで相互作用的かつ個別的な特徴をモデル化する。ベースモデル(49.0Mパラメータ)を用いてImageNet-1Kで83.9%のTop-1精度を達成し、SOTA手法を上回る性能を示した。COCO検出およびADE20Kセグメンテーションでも、FLOPsを抑えながらSOTA性能を達成した。

ABSTRACT

Motivated by biological evolution, this paper explains the rationality of Vision Transformer by analogy with the proven practical evolutionary algorithm (EA) and derives that both have consistent mathematical formulation. Then inspired by effective EA variants, we propose a novel pyramid EATFormer backbone that only contains the proposed EA-based transformer (EAT) block, which consists of three residual parts, i.e., Multi-scale region aggregation, global and local interaction, and feed-forward network modules, to model multi-scale, interactive, and individual information separately. Moreover, we design a task-related head docked with transformer backbone to complete final information fusion more flexibly and improve a modulated deformable MSA to dynamically model irregular locations. Massive quantitative and quantitative experiments on image classification, downstream tasks, and explanatory experiments demonstrate the effectiveness and superiority of our approach over state-of-the-art methods. E.g., our Mobile (1.8 M), Tiny (6.1 M), Small (24.3 M), and Base (49.0 M) models achieve 69.4, 78.4, 83.1, and 83.9 Top-1 only trained on ImageNet-1K with naive training recipe; EATFormer-Tiny/Small/Base armed Mask-R-CNN obtain 45.4/47.4/49.0 box AP and 41.4/42.9/44.2 mask AP on COCO detection, surpassing contemporary MPViT-T, Swin-T, and Swin-S by 0.6/1.4/0.5 box AP and 0.4/1.3/0.9 mask AP separately with less FLOPs; Our EATFormer-Small/Base achieve 47.3/49.3 mIoU on ADE20K by Upernet that exceeds Swin-T/S by 2.8/1.7. Code is available at https://github.com/zhangzjn/EATFormer.

研究の動機と目的

  • ビジョントランスフォーマーの構造的構成要因が、実証済みの進化的計算(EA)の演算子(クロスオーバーと突然変異)と正式に同等であることを示し、EA演算子と自己注意/FFNコンponentsの間の共通する数学的定式化を明らかにする。
  • 特にグローバルおよびローカル集団モデリングに重点を置いた効果的なEA変種を統合することで、ビジョントランスフォーマーの特徴表現を向上させる。
  • 提案されたEATブロックのみから構成される新しいピラミッド型EATFormerバックボーンを設計し、マルチスケール、相互作用的、個別的特徴モデリングを可能にする。
  • 柔軟な最終融合を可能にするためのタスク関連ヘッド(TRH)を導入し、および不規則な空間的位置を動的にモデリングするためのモodulated Deformable MSA(MD-MSA)を提案する。
  • 画像分類、オブジェクト検出、セマンティックセグメンテーションの各タスクにおいて、優れた性能と効率性を示し、アブレーションおよび可視化研究を通じて設計選択の妥当性を検証する。

提案手法

  • ビジョントランスフォーマーにおけるマルチヘッド自己注意(MSA)と進化的計算におけるクロスオーバー演算子との間の数学的同等性を導出する。また、フィードフォワードネットワーク(FFN)と突然変異演算子との同等性も示す。
  • MSRA(マルチスケール・リージョンアグリゲーション)によるマルチスケール特徴抽出、GLI(グローバル・ローカル相互作用)による並列的なグローバルおよびローカルモデリング、FFNによる個別的特徴強化を統合したEATブロックを提案する。これは残差構造に基づく。
  • タスク関連ヘッド(TRH)モジュールを導入し、トランスフォーマーバックボーンに接続することで、クロスアテンション機構を介した柔軟でタスク固有の情報統合を可能にする。
  • 動的サンプリングオフセットとモodulation重みを学習するモodulated Deformable MSA(MD-MSA)を設計し、不規則な空間配置への適応的注意を可能にする。
  • EATFormerバックボーンの評価のため、ImageNet-1Kにナイーブなトレーニングレシピを適用し、GLI、MD-MSA、TRHのアブレーションスタディにより各モジュールの貢献度を検証する。
  • 画像分類、COCOオブジェクト検出、ADE20Kセマンティックセグメンテーションの広範な実験を実施し、アテンション可視化およびFLOPs/パラメータ分布分析を含む。

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーの構造的構成要素は、クロスオーバーや突然変異といった進化的計算の演算子と正式にリンク可能か?
  • RQ2EAの変種から得られるグローバルおよびローカル集団モデリングを統合することで、ビジョントランスフォーマーにおける特徴表現はどのように向上するか?
  • RQ3MSRA、GLI、FFNを備えた提案されたEATブロックは、標準的なViTブロックと比較して、マルチスケールおよび相互作用的特徴学習をどの程度向上させるか?
  • RQ4タスク関連ヘッド(TRH)は、標準的な分類ヘッドと比較して、最終的特徴統合をどのように改善するか?
  • RQ5MD-MSAモジュールは、標準的なMSAと比較して不規則な空間位置をより効果的に動的にモデリングできるか?また、密な予測タスクにおける性能にどのような影響を与えるか?

主な発見

  • EATFormer-Baseは、49.0MパラメータでImageNet-1Kで83.9%のTop-1精度を達成し、同じトレーニングレシピ下でSOTA手法を上回った。
  • EATFormer-Tiny、Small、Baseは、それぞれ78.4%、83.1%、83.9%のTop-1精度を達成し、小型モデルでも強力な性能を示した。
  • COCOオブジェクト検出では、EATFormer-Tiny/Small/Baseが45.4/47.4/49.0のボックスAPおよび41.4/42.9/44.2のマスクAPを達成し、Swin-T/SおよびMPViT-Tを0.6/1.4/0.5および0.4/1.3/0.9のAP上回り、FLOPsも少ない。
  • ADE20Kセマンティックセグメンテーションでは、EATFormer-Small/BaseがUperNetを用いて47.3/49.3のmIoUを達成し、Swin-T/Sを2.8/1.7 mIoU上回った。
  • 可視化により、GLIが広範囲の領域への注目を強化し、特に最後の段階で、ローカルモデリングがないモデルが示すような疎な領域への過剰集中を軽減することが確認された。
  • パラメータおよびFLOPs分析から、FFNがパラメータ数の大部分を占め、初期段階がFLOPsの大部分を占めることが判明した。これは、FFNおよび初期層における最適化の余地があることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。