Skip to main content
QUICK REVIEW

[論文レビュー] HRDNet: High-resolution Detection Network for Small Objects

Ziming Liu, Guangyu Gao|arXiv (Cornell University)|Jun 13, 2020
Advanced Neural Network Applications参考文献 26被引用数 16
ひとこと要約

HRDNet は、マルチディープネス・イメージピラミッドネットワーク(MD-IPN)とマルチスケール・フィーチャピラミッドネットワーク(MS-FPN)を用いて、複数の深さと解像度の特徴を統合することで、小サイズの物体検出を向上させる新規な高解像度検出ネットワークである。MS COCO、Pascal VOC、VisDrone2019 において最先端の性能を達成しており、従来手法と比較して小サイズ物体で 4.9% 以上の AP 向上を実現した。

ABSTRACT

Small object detection is challenging because small objects do not contain detailed information and may even disappear in the deep network. Usually, feeding high-resolution images into a network can alleviate this issue. However, simply enlarging the resolution will cause more problems, such as that, it aggravates the large variant of object scale and introduces unbearable computation cost. To keep the benefits of high-resolution images without bringing up new problems, we proposed the High-Resolution Detection Network (HRDNet). HRDNet takes multiple resolution inputs using multi-depth backbones. To fully take advantage of multiple features, we proposed Multi-Depth Image Pyramid Network (MD-IPN) and Multi-Scale Feature Pyramid Network (MS-FPN) in HRDNet. MD-IPN maintains multiple position information using multiple depth backbones. Specifically, high-resolution input will be fed into a shallow network to reserve more positional information and reducing the computational cost while low-resolution input will be fed into a deep network to extract more semantics. By extracting various features from high to low resolutions, the MD-IPN is able to improve the performance of small object detection as well as maintaining the performance of middle and large objects. MS-FPN is proposed to align and fuse multi-scale feature groups generated by MD-IPN to reduce the information imbalance between these multi-scale multi-level features. Extensive experiments and ablation studies are conducted on the standard benchmark dataset MS COCO2017, Pascal VOC2007/2012 and a typical small object dataset, VisDrone 2019. Notably, our proposed HRDNet achieves the state-of-the-art on these datasets and it performs better on small objects.

研究の動機と目的

  • 深層ネットワークにおけるダウンサンプリングに起因する小サイズ物体の特徴の消失という課題に対処する。
  • 高解像度入力の利点(空間的詳細の保持)と欠点(計算コストの増加およびスケールのばらつき)のトレードオフを解消する。
  • 計算オーバーヘッドを最小限に抑えつつ、小サイズおよび大サイズ物体の両方で高い検出精度を維持する。
  • 異なる解像度および深さの特徴を効果的に統合するマルチストリーム・マルチディープ構造を設計する。

提案手法

  • HRDNet は、固定の減少率 α を用いて複数の入力解像度を扱い、高解像度画像を浅いバックボーンに、低解像度画像を深いバックボーンに供給する。
  • マルチディープネス・イメージピラミッドネットワーク(MD-IPN)は、異なる解像度ストリームからマルチスケール特徴を抽出し、空間的および意味的情報を保持する。
  • MD-IPN は、高解像度入力には浅いバックボーン、低解像度入力には深いバックボーンを用いることで、位置情報と詳細情報を維持する。
  • マルチスケール・フィーチャピラミッドネットワーク(MS-FPN)は、複数の解像度ストリームおよびレベル間の特徴を統合し、マルチスケール・マルチレベル特徴間の情報の不均衡を低減する。
  • MS-FPN はストリーム間およびストリーム内での特徴伝搬を可能にし、スケールをまたがる特徴表現を強化する。
  • モデルはエンドツーエンドで訓練され、境界ボックスおよび分類予測のための標準的な検出ヘッドが使用される。

実験結果

リサーチクエスチョン

  • RQ1計算コストの増加なしに、マルチ解像度・マルチディープ特徴抽出戦略が小サイズ物体検出を向上させられるか?
  • RQ2異なる入力解像度で浅いバックボーンと深いバックボーンの特徴を統合することで、小サイズ物体の検出性能にどのような影響を与えるか?
  • RQ3提案された MS-FPN アーキテクチャが、マルチスケールおよびマルチレベル特徴間の情報の不均衡を効果的に低減できるか?
  • RQ4HRDNet は、単一バックボーンモデルおよびモデルアンサンブルと比較して、精度と推論速度の両面で優れているか?
  • RQ5HRDNet の性能向上は、モデル容量の増加ではなく、アーキテクチャ的革新に起因するか?

主な発見

  • VisDrone2019 DET 開発セットにおいて、HRDNet は 40.45 の mAP を達成し、ResNet152 を用いた HFEA と比較して 3.0% の AP 向上を示した。
  • MS COCO2017 において、HRDNet は最近のモデルと比較して小サイズ物体で 4.9% の AP 向上を達成し、優れた一般化性能を示した。
  • ResNeXt50+101 バックボーンを搭載した HRDNet は、Pascal VOC 2007 テストで 83.4% の mAP を達成し、以前の最先端手法を上回った。
  • HRDNet は高い効率性を維持しており、同程度のパラメータ数の単一バックボーンアンサンブルと比較して優れた性能を発揮し、より高速な推論速度を達成した。
  • アブレーションスタディの結果、MS-FPN が性能向上に不可欠であることが確認され、HRDNet はモデルアンサンブルおよび単一解像度ベースラインを上回った。
  • 大サイズ物体の性能を維持しながら、小サイズ物体の検出を顕著に向上させ、解像度-スケールのトレードオフを解決した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。