Skip to main content
QUICK REVIEW

[論文レビュー] DeRPN: Taking a further step toward more general object detection

Lele Xie, Yuliang Liu|arXiv (Cornell University)|Nov 16, 2018
Advanced Neural Network Applications参考文献 29被引用数 5
ひとこと要約

この論文では、固定アンカーボックスに依存することなく、柔軟なアンカーストリングを用いて物体の幅と高さの予測を分離する、新しい次元分解領域提案ネットワークDeRPNを提案する。一般物体検出(Pascal VOC、MS COCO)およびシーンテキスト検出(ICDAR 2013、COCO-Text)の両方で、ハイパーパrameterチューニングなしで最先端の性能を達成し、COCO-TextではF-measureでRPNを最大10%上回る性能を発揮しながら、同じ推論速度を維持する。

ABSTRACT

Most current detection methods have adopted anchor boxes as regression references. However, the detection performance is sensitive to the setting of the anchor boxes. A proper setting of anchor boxes may vary significantly across different datasets, which severely limits the universality of the detectors. To improve the adaptivity of the detectors, in this paper, we present a novel dimension-decomposition region proposal network (DeRPN) that can perfectly displace the traditional Region Proposal Network (RPN). DeRPN utilizes an anchor string mechanism to independently match object widths and heights, which is conducive to treating variant object shapes. In addition, a novel scale-sensitive loss is designed to address the imbalanced loss computations of different scaled objects, which can avoid the small objects being overwhelmed by larger ones. Comprehensive experiments conducted on both general object detection datasets (Pascal VOC 2007, 2012 and MS COCO) and scene text detection datasets (ICDAR 2013 and COCO-Text) all prove that our DeRPN can significantly outperform RPN. It is worth mentioning that the proposed DeRPN can be employed directly on different models, tasks, and datasets without any modifications of hyperparameters or specialized optimization, which further demonstrates its adaptivity. The code will be released at https://github.com/HCIILAB/DeRPN.

研究の動機と目的

  • 異なるデータセット間でアンカーボックスの設定に敏感な、アンカーベースの検出器の一般化性能の低さを是正すること。
  • 異なる検出タスクにおいて、手動またはK-meansベースのアンカーボックス設計の必要性を排除すること。
  • テキストのような小形・縦長の物体に対して、幅と高さの予測を分離することで、検出性能を向上させること。
  • 計算効率を維持しつつ、領域提案の品質とリcallを向上させること。
  • モデル・タスク・データセットの違いに関係なく、変更なしに普遍的に使用可能なプラグアンドプレイ型の領域提案モジュールを開発すること。

提案手法

  • DeRPNは、物体の幅と高さの予測を分離するアンカーストリング機構を導入し、予測された次元を正例と独立して照合可能にする。
  • 固定アンカーボックスの代わりに、多様な物体のアスペクト比に対応できる柔軟なアンカーストリングを採用する。
  • 小形物体が損なわれないよう、異なるオブジェクトスケール間の損失寄与度をバランスさせるスケール感受性損失関数を提案する。
  • 標準RPNと同一のネットワークアーキテクチャと推論速度を維持しており、2段階検出器へのシームレスな統合を可能にする。
  • 次元分解機構により、回帰の複雑さが低減され、より正確で安定した学習が可能になる。
  • 本手法は普遍的に適用可能であり、ハイパーパrameterチューニングやタスク固有の最適化を一切必要としない。

実験結果

リサーチクエスチョン

  • RQ1アンカーボックスの再設定を必要とせずに、多様なデータセットに一般化可能な領域提案ネットワークを設計できるか?
  • RQ2幅と高さの予測を分離することで、極端なアスペクト比を持つオブジェクトの検出性能にどのような影響を与えるか?
  • RQ3スケール感受性損失関数は、小形物体と大形物体間の損失寄与度の不均衡を効果的に是正できるか?
  • RQ4DeRPNは、変更なしに一般物体検出およびシーンテキスト検出のような特殊タスクにおいて、RPNを上回る性能を発揮するか?
  • RQ5DeRPNは、再トレーニングやハイパーパrameterチューニングなしに、さまざまなモデルやデータセットにプラグインモジュールとして導入可能か?

主な発見

  • DeRPNは、シングルスケールテスト下でCOCO-Textで57.11%のF-measureを達成し、それまでのあらゆる手法、特に特化したシーンテキスト検出器を上回った。
  • COCO-Textでは、K-meansベースの最良RPNバージョンを10ポイント以上上回るF-measureを記録し、AP50が53.43%、IoU 50でのリcallが73.74%を達成した。
  • DeRPNはRPNとほぼ同等の推論速度を維持しており、1枚のTITAN XP GPU上でのFPSは標準RPNと同等であった。
  • Pascal VOCおよびMS COCOにおいて、DeRPNはRPNに比べて顕著にリcallとAPスコアを向上させ、優れた領域提案品質を示した。
  • ハイパーパrameter調整やタスク固有の微調整なしに、一般検出およびシーンテキスト検出ベンチマークで最先端の性能を達成した。
  • 可視化例から、DeRPNが極端なアスペクト比を持つ小形・縦長のテキストオブジェクトを効果的に検出でき、形状の変動に対しても頑健であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。