Skip to main content
QUICK REVIEW

[論文レビュー] MRDet: A Multi-Head Network for Accurate Oriented Object Detection in Aerial Images

Qin Ran, Qingjie Liu|arXiv (Cornell University)|Dec 24, 2020
Advanced Neural Network Applications参考文献 51被引用数 7
ひとこと要約

MRDetは、パラメータ増加を最小限に抑えて正確な回転方向提案を生成する、軽量なマルチヘッド回転物体検出器を提案する。任意方向の領域提案ネットワーク(AO-RPN)を用い、分類、局所化、スケール、方向予測を分離したマルチヘッドネットワークにより、精度を向上させる。DOTAでは76.24%、HRSC2016では89.94%のSOTA mAPを達成した。

ABSTRACT

Objects in aerial images usually have arbitrary orientations and are densely located over the ground, making them extremely challenge to be detected. Many recently developed methods attempt to solve these issues by estimating an extra orientation parameter and placing dense anchors, which will result in high model complexity and computational costs. In this paper, we propose an arbitrary-oriented region proposal network (AO-RPN) to generate oriented proposals transformed from horizontal anchors. The AO-RPN is very efficient with only a few amounts of parameters increase than the original RPN. Furthermore, to obtain accurate bounding boxes, we decouple the detection task into multiple subtasks and propose a multi-head network to accomplish them. Each head is specially designed to learn the features optimal for the corresponding task, which allows our network to detect objects accurately. We name it MRDet short for Multi-head Rotated object Detector for convenience. We test the proposed MRDet on two challenging benchmarks, i.e., DOTA and HRSC2016, and compare it with several state-of-the-art methods. Our method achieves very promising results which clearly demonstrate its effectiveness.

研究の動機と目的

  • 深層学習を用いて、空中画像における密集した任意方向の物体を検出する課題に対処する。
  • 密集したアノテーションの配置を避けることで、回転物体検出における計算コストとモデルの複雑さを低減する。
  • 専用のネットワークヘッドを用いて検出サブタスクを分離することで、検出精度を向上させる。
  • 任意方向の物体が密集するシーンにおいて、効率性と性能のバランスを取る。
  • 回転物体検出のベンチマークデータセットであるDOTAおよびHRSC2016で、最先端の性能を達成する。

提案手法

  • 標準RPNと同等のアンカーデータ数を維持しながら、アフィン変換を学習することで水平方向の提案を回転方向の提案に変換する、任意方向の領域提案ネットワーク(AO-RPN)を提案する。
  • 分類、バウンディングボックスの局所化、スケール推定、方向予測の4つのスイーベィングヘッドを備えたマルチヘッドネットワーク(MH-Net)を導入し、それぞれのタスクに最適化された構造とする。
  • 正確なバウンディングボックス回帰のための特徴表現を向上させるために、局所化ヘッドにセンター・プーリングモジュールを統合する。
  • 方向予測に全結合層を用い、畝型ブランンチよりも精度が優れていることを実証した。
  • 小規模およびマルチスケールの物体検出を改善するため、特徴マップのピラミッドネットワーク(FPN)を活用する。
  • 分類、局所化、スケール、方向予測の損失を統合したマルチタスク損失を用いて、エンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1アンカーデンシティや計算コストを増加させることなく、軽量な領域提案ネットワークが正確な回転方向の提案を生成できるか?
  • RQ2分類、局所化、スケール、方向予測の検出サブタスクを別々のネットワークヘッドで分離することで、空中画像における検出精度が向上するか?
  • RQ3局所化ヘッドにおけるセンター・プーリングが、回転物体検出におけるバウンディングボックス回帰性能に与える影響は何か?
  • RQ4提案されたマルチヘッド設計は、小規模で密集し、任意方向の物体を検出する際、共有ヘッドアーキテクチャを上回る性能を示せるか?
  • RQ5本手法は、オブジェクトのスケール、アスペクト比、方向が異なる多様な空中データセットに一般化可能か?

主な発見

  • FPNを用いたDOTAデータセットでは、MRDetはmAP 76.24%を達成し、前回最良結果(75.74%)を0.5%上回った。
  • FPNなしのDOTAデータセットでは、MRDetはmAP 73.62%を達成し、前回最良手法(61.01%)を12.55ポイント上回った。
  • 高密度で類似した方向を持つ大型の車両や船といった困難なカテゴリでは、それぞれmAPが2.23%および1.04%向上した。
  • HRSC2016では、MRDetがmAP 89.94%を達成し、2番目に良い手法(88.20%)を1.74ポイント、RoI Transformerを3.74ポイント上回った。
  • 可視化比較では、RoI Transformer、Gliding Vertex、SCRDetと比較して、特に小規模で低解像度のオブジェクトにおいて、よりタイトで正確なバウンディングボックスを検出していることが示された。
  • 橋など極めて大きなサイズや高アスペクト比のオブジェクトでは、mAPが55.40%にとどまり、クラスの不均衡とスケール変動が依然として課題であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。