Skip to main content
QUICK REVIEW

[論文レビュー] Feature Pyramid Transformer

Dong Zhang, Hanwang Zhang|arXiv (Cornell University)|Jul 18, 2020
Advanced Neural Network Applications参考文献 47被引用数 7
ひとこと要約

本稿では、空間的およびスケール次元における非局所的でクロススケールの相互作用を明示的にモデル化することで、特徴マップのピラミッドを強化する、新しい自己注意ベースのモジュールである特徴マップピラミッド変換器(FPT)を提案する。自己レベル、トップダウン、ボトムアップの3つの変換器を統合することで、計算コストを最小限に抑えながら、オブジェクト検出およびセマンティックセグメンテーションの性能を向上させ、複数のベンチマークでSOTAのmIoU向上を1.6–1.8%達成した。

ABSTRACT

Feature interactions across space and scales underpin modern visual recognition systems because they introduce beneficial visual contexts. Conventionally, spatial contexts are passively hidden in the CNN's increasing receptive fields or actively encoded by non-local convolution. Yet, the non-local spatial interactions are not across scales, and thus they fail to capture the non-local contexts of objects (or parts) residing in different scales. To this end, we propose a fully active feature interaction across both space and scales, called Feature Pyramid Transformer (FPT). It transforms any feature pyramid into another feature pyramid of the same size but with richer contexts, by using three specially designed transformers in self-level, top-down, and bottom-up interaction fashion. FPT serves as a generic visual backbone with fair computational overhead. We conduct extensive experiments in both instance-level (i.e., object detection and instance segmentation) and pixel-level segmentation tasks, using various backbones and head networks, and observe consistent improvement over all the baselines and the state-of-the-art methods.

研究の動機と目的

  • 従来の手法が特徴マップのピラミッドにおいて非局所的でクロススケールの視覚的文脈を捉える能力に限界を示していることに対処すること。
  • 従来のCNNをはるかに超える空間的およびスケールに配慮した特徴相互作用を能動的にモデル化する汎用的でプラグアンドプレイなバックボーンを設計すること。
  • より豊かな文脈的特徴表現を通じて、インスタンスレベル(オブジェクト検出、インスタンスセグメンテーション)およびピクセルレベル(セマンティックセグメンテーション)のタスク性能を向上させること。
  • 多様な視覚認識タスクにおいて、特徴表現の質を顕著に向上させつつも、計算効率を維持すること。

提案手法

  • 入力の特徴マップピラミッドを、同じサイズのより豊かな文脈的特徴を備えたピラミッドに変換する特徴マップピラミッド変換器(FPT)を提案する。
  • 3つの専用変換器を導入する:自己レベルの空間的相互作用を処理する自己変換器(ST)、トップダウンのスケールに配慮した相互作用を処理する局所的・グローバル変換器(LGT)、ボトムアップのスケールに配慮した相互作用を処理する表現変換器(RT)。
  • 学習可能なクエリ、キー、バリューを用いたマルチヘッド自己注意機構を採用し、空間的およびスケール次元にわたる長距離で非局所的な依存関係を明示的にモデル化する。
  • 特徴マップの解像度とサイズを変更せずに処理を維持することで、既存の検出およびセグメンテーションヘッドとのシームレスな統合を可能にする。
  • 制御されたFLOPsおよびパラメータ増加(例:LGTでは+0.44×パラメータ、+0.10×GFLOPs)を実現する軽量設計を採用し、公平な計算コストを確保する。
  • FPTをさまざまなバックボーン(例:ResNet-101)および特徴マップピラミッドアーキテクチャ(UFP、PPM、ASPP)の上に汎用モジュールとして適用し、広範な互換性を示した。

実験結果

リサーチクエスチョン

  • RQ1明示的でクロススケールの特徴相互作用は、従来のCNNベースまたは非局所的空間のみの手法をはるかに超えて視覚認識性能を向上させることができるか?
  • RQ2自己注意機構は、空間的領域だけでなく、異なる特徴マップピラミッドレベル間の非局所的相互作用をどのようにモデル化できるか?
  • RQ3FPTは、SOTA手法と比較して、インスタンスレベルおよびピクセルレベルのセグメンテーションタスクにおいてどの程度性能を向上させるか?
  • RQ4FPTは、多様なベンチマークおよびバックボーンアーキテクチャにおいて、顕著に特徴表現の質を向上させつつも、高い効率を維持できるか?

主な発見

  • FPTは、Cityscapes、ADE20K、LIP、PASCAL VOC 2012の各ベンチマークでSOTA性能を達成し、同じResNet-101バックボーンを用いた前回のSOTA手法と比較して、mIoUをそれぞれ1.6%、1.2%、1.7%、1.8%向上させた。
  • アブレーションスタディの結果、3つの変換器(ST、LGT、RT)を併用した場合が最良の性能を示し、CityscapesではUFPベースラインと比較して2.6%高い検証mIoUを達成した。
  • 自己変換器(ST)単体でも、UFPベースラインと比較して検証mIoUが1.6%向上し、自己レベルの非局所的相互作用の有効性を示した。
  • FPTは、SOTAのOCNetと比較して、Cityscapes、ADE20K、LIP、PASCAL VOC 2012の各タスクでそれぞれ0.9%、1.1%、1.3%、0.8%のmIoU向上を達成した。
  • 定性的な結果から、FPTは境界予測をより正確にし、小さな物体や細い物体(例:フェンス、人の足)のセグメンテーション性能がベースラインおよびOCNetを上回ることがわかった。
  • モデルは公平な計算コストを維持しており、UFPベースラインと比較して、パラメータは最大で0.44×、GFLOPsは最大で0.10×に増加した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。