Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Coarse-to-Fine Non-Local Module for the Detection of Small Objects

Hila Levi, Shimon Ullman|arXiv (Cornell University)|Nov 29, 2018
Advanced Neural Network Applications参考文献 61被引用数 8
ひとこと要約

本稿では、オブジェクト検出ネットワークのトップダウンパスに統合された効率的な粗-細分化非局所モジュールを提案し、小サイズオブジェクトの検出を向上させる。解像度を段階的に向上させながらメモリ最適化された非局所ブロックを適用することで、大規模なオブジェクトから小規模なオブジェクトへと長距離の文脈的推論を可能にするとともに、クラスの繰り返しを活用し、Faster R-CNN や Mask R-CNN に標準的な非局所モジュールを適用した場合と比較して COCO における小サイズオブジェクトの AP が 1–2 ポints 向上する。

ABSTRACT

An image is not just a collection of objects, but rather a graph where each object is related to other objects through spatial and semantic relations. Using relational reasoning modules, such as the non-local module \cite{wang2017non}, can therefore improve object detection. Current schemes apply such dedicated modules either to a specific layer of the bottom-up stream, or between already-detected objects. We show that the relational process can be better modeled in a coarse-to-fine manner and present a novel framework, applying a non-local module sequentially to increasing resolution feature maps along the top-down stream. In this way, information can naturally passed from larger objects to smaller related ones. Applying the module to fine feature maps further allows the information to pass between the small objects themselves, exploiting repetitions of instances of the same class. In practice, due to the expensive memory utilization of the non-local module, it is infeasible to apply the module as currently used to high-resolution feature maps. We redesigned the non local module, improved it in terms of memory and number of operations, allowing it to be placed anywhere along the network. We further incorporated relative spatial information into the module, in a manner that can be incorporated into our efficient implementation. We show the effectiveness of our scheme by improving the results of detecting small objects on COCO by 1-2 AP points over Faster and Mask RCNN and by 1 AP over using non-local module on the bottom-up stream.

研究の動機と目的

  • 特徴マップ内の長距離の空間的および意味的関係をモデル化することで、小サイズオブジェクトの検出を向上させること。
  • 検出ネットワークにおける高解像度特徴マップに標準的な非局所モジュールを適用した場合の高いメモリおよび計算コストを緩和すること。
  • 粗-細分化処理戦略を用いることで、小サイズオブジェクト同士、および小サイズと関連する大規模オブジェクトの間の有効な関係的推論を可能にすること。
  • メモリ効率の良い非局所モジュールに相対的な空間符号化を統合し、計算オーバーヘッドを増加させることなく特徴表現を強化すること。
  • 非局所モジュールをボトムアップではなくトップダウンパスに適用することで、小サイズオブジェクト検出においてより優れた性能が得られることを示すこと。

提案手法

  • 注目計算の因子分解とグループ化演算の使用により、メモリと FLOPs を削減した効率的な非局所(ENL)モジュールを提案する。
  • 特徴マップのピラミッドネットワーク(FPN)のトップダウンパスに沿って、ENL モジュールを順次統合し、各アップサンプリング層の前に配置する。
  • 局所化精度の向上を図るため、学習可能な位置符号化埋め込みを用いて注目メカニズムに相対的な空間符号化を統合する。
  • 高レベルの文脈から細粒度特徴へと至る粗-細分化推論を可能にするために、複数のスケール(res3, res4, res5)にENLモジュールを適用する。
  • バッチ正規化をENLブロック内に含めず、ResNet-50 と FPN を用いた標準的な Faster R-CNN および Mask R-CNN バックボーンとエンドツーエンドで学習する。
  • すべてのENLモジュールで共有される軽量な注目ヘッドを用いることで、効率性を維持しつつスケール間の特徴相互作用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1トップダウンパスに沿って粗-細分化で非局所モジュールを適用することで、長距離の文脈を活用して小サイズオブジェクト検出が向上するか?
  • RQ2標準的な非局所モジュールの高いメモリコストをどのように低減し、低レベルの高解像度特徴マップに適用可能な状態にできるか?
  • RQ3非局所注目メカニズムに相対的な空間情報を統合することで、小サイズおよび重複するオブジェクトの検出性能が向上するか?
  • RQ4同一クラスの繰り返しインスタンスが、特徴空間における関係的推論を通じて小サイズオブジェクト検出に有効に活用できるか?
  • RQ5非局所推論によるトップダウンモodulationが、オブジェクト検出ベンチマークにおいてボトムアップ統合よりも優れた性能を示すか?

主な発見

  • 提案されたENLモジュールは、ボトムアップパスに非局所モジュールを適用した標準的な Faster R-CNN や Mask R-CNN と比較して、COCO における小サイズオブジェクトのAPを 1–2 ポイント向上させる。
  • ENLモジュールの粗-細分化適用により、関連する大規模オブジェクト(例:岸辺の人物が海中のスイマーの検出を支援)の存在に基づいて小サイズオブジェクトを検出可能になる。
  • 非局所注目メカニズムを用いることで、同じクラスの複数の重複インスタンス(例:群れの鳥)を効果的に検出可能になる。
  • ENLモジュールに相対的な空間符号化を統合することで、小サイズで密に配置されたオブジェクトが特徴として存在するシーンでも局所化精度が向上する。
  • ENLモジュールの効率的な設計により、制約の厳しいメモリコストを伴わず、低レベルの高解像度特徴マップに適用可能となり、効果的な長距離特徴集約が可能になる。
  • 定性的な結果から、モデルは特に低照度条件や高密度オブジェクトシーンにおいて、より正確で完全な領域候補および検出結果を生成することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。