[論文レビュー] Local-to-Global Self-Attention in Vision Transformers
本稿では、ビジョントランスフォーマーにおけるマルチパス自己注意機構であるLG-Transformerを提案する。この機構により、各ステージ内で複数スケールにおける局所的からグローバルな特徴推論が可能となる。特徴マップを異なる解像度(局所的:1/8、ミドルレベル:1/16、グローバル:1/32)にダウンサンプリングし、それらにウィンドウベースのマルチヘッド自己注意(W-MSA)を適用することで、局所的詳細とグローバルコンテキストの両方を、計算コストをほとんど増加させずに効率的に捉える。ImageNetではTop-1精度が0.9%向上し、ADE20KではmIoUが0.8%向上する。
Transformers have demonstrated great potential in computer vision tasks. To avoid dense computations of self-attentions in high-resolution visual data, some recent Transformer models adopt a hierarchical design, where self-attentions are only computed within local windows. This design significantly improves the efficiency but lacks global feature reasoning in early stages. In this work, we design a multi-path structure of the Transformer, which enables local-to-global reasoning at multiple granularities in each stage. The proposed framework is computationally efficient and highly effective. With a marginal increasement in computational overhead, our model achieves notable improvements in both image classification and semantic segmentation. Code is available at https://github.com/ljpadam/LG-Transformer
研究の動機と目的
- 局所的自己注意により早期段階でグローバルな推論が欠如する階層的ビジョントランスフォーマーの限界を解消すること。
- CNNの局所的インダクティブバイアスとトランスフォーマーのグローバルモデリング能力を統合した、1つの効率的なアーキテクチャを構築すること。
- 計算コストを著しく増加させることなく、画像分類およびセマンティックセグメンテーションの性能を向上させること。
- 多スケールの注意パスが特徴表現の向上に寄与することを検証すること。
提案手法
- 特徴マップを3つのスケール(元の解像度の1/8、1/16、1/32)にダウンサンプリングするマルチパス自己注意モジュールを設計する。
- 各スケールに対して独立にウィンドウベースのマルチヘッド自己注意(W-MSA)を適用し、局所的およびグローバルな依存関係をモデル化する。
- 各ステージで全パスからの特徴を統合し、より判別力のある表現を形成する。
- Swin Transformerをインspiredとした階層的トランスフォーマー・アーキテクチャを採用するが、各ブロックに複数の注意パスを拡張する。
- グローバル注意を最小スケール(1/32)に限定することで、計算コストを削減し、計算効率を維持する。
- 新しい演算を導入せず、互換性と統合の容易さを確保する。
実験結果
リサーチクエスチョン
- RQ1複数の粒度における局所的からグローバルな特徴推論が、高い計算コストを伴わずにビジョントランスフォーマーの性能向上に寄与するか?
- RQ2マルチパス注意と単一パスの局所的注意の間で、収束性および精度にどのような差が生じるか?
- RQ3局所的およびグローバルな注意パスを組み合わせることで、画像分類およびセマンティックセグメンテーションにおける一般化性能が向上するか?
- RQ4性能向上を得るためのマルチパスブロックの最適な配置は、各ステージのどこか?
- RQ5推論速度において、本モデルは標準の単一パストランスフォーマーと比較してどうなるか?
主な発見
- LG-Transformerは、FLOPsの増加がわずかであるにもかかわらず、ImageNet-1K分類タスクでSwin-TransformerよりTop-1精度が0.9%高い。
- ADE20Kセマンティックセグメンテーションベンチマークでは、Swin-T*よりmIoUが0.8%向上し、パラメータ数とFLOP予算が同程度の競争力ある性能を達成した。
- ベースラインモデルよりも収束が早く、訓練損失が低く、検証精度が高いため、最適化の安定性が向上していることが示された。
- 定性的な分析では、局所的注意マップ(1/8および1/16スケール)に明確な不連続性が観察されたが、グローバル注意(1/32)は一貫性があり、全体像のコンテキストを捉えていた。
- より多くの段階にLG-Attentionブロックを追加することで、検証性能と訓練収束性が一貫して向上した。これはマルチパス設計の利点を示している。
- 精度向上は達成されたが、マルチパス構造のため、単一パスの対比モデルに比べて推論速度が遅く、精度と速度のトレードオフが生じている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。