Skip to main content
QUICK REVIEW

[論文レビュー] Hit-Detector: Hierarchical Trinity Architecture Search for Object Detection

Jianyuan Guo, Kai Han|arXiv (Cornell University)|Mar 26, 2020
Advanced Neural Network Applications参考文献 53被引用数 15
ひとこと要約

Hit-Detector は、オブジェクト検出器のバックボーン、ネック、ヘッドの各コンポonentをエンドツーエンドで同時に最適化する階層的トライニティアーキテクチャ探索フレームワークを提案する。コンポーネント固有の演算選好を特定し、グループスパarsity正則化を用いて動的にサブサーチスペースをスクリーニングすることで、2700万パラメータで COCO minival で 41.4% の mAP を達成し、手作業設計されたモデルや別々に探索されたモデルを上回る性能を発揮する。

ABSTRACT

Neural Architecture Search (NAS) has achieved great success in image classification task. Some recent works have managed to explore the automatic design of efficient backbone or feature fusion layer for object detection. However, these methods focus on searching only one certain component of object detector while leaving others manually designed. We identify the inconsistency between searched component and manually designed ones would withhold the detector of stronger performance. To this end, we propose a hierarchical trinity search framework to simultaneously discover efficient architectures for all components (i.e. backbone, neck, and head) of object detector in an end-to-end manner. In addition, we empirically reveal that different parts of the detector prefer different operators. Motivated by this, we employ a novel scheme to automatically screen different sub search spaces for different components so as to perform the end-to-end search for each component on the corresponding sub search space efficiently. Without bells and whistles, our searched architecture, namely Hit-Detector, achieves 41.4\% mAP on COCO minival set with 27M parameters. Our implementation is available at https://github.com/ggjy/HitDet.pytorch.

研究の動機と目的

  • オブジェクト検出器における手作業設計されたコンポーネントと探索されたコンポーネントの不一致が引き起こす性能低下を是正すること。
  • バックボーン、ネック、ヘッドのすべての検出器コンポーネントに対して、エンドツーエンドで神経ネットワークアーキテクチャ探索を可能にすること。
  • 演算選好に基づいてコンポーネント固有のサブサーチスペースを特定・フィルタリングすることで、探索の効率を向上させること。
  • アーキテクチャの装飾要素を一切用いずに、最先端の検出精度を達成すること。

提案手法

  • バックボーン、ネック、ヘッドコンポーネントの全領域でエンドツーエンドのアーキテクチャ探索を実行する階層的トライニティ探索フレームワークを導入する。
  • グループスパarsity正則化を用いて、各コンポーネントの好む演算に特化したサブサーチスペースを自動的に特定・抽出する。
  • 各コンポーネント固有のサブサーチスペース内で、効率的にアーキテクチャを最適化するため、微分可能アーキテクチャ探索(DARTS風)を採用する。
  • 逆残差、深度可分、およびさまざまなカーネルサイズ、拡張率、拡大率を有する標準畳み込みを含む、合計32種類の演算候補を含む統一されたサーチスペースを設計する。
  • 一般化評価のため、2段階(Faster R-CNN)および1段階(RetinaNet)の検出器に同じ探索手順を適用する。
  • 標準的な 1x および 3x スケジュールを用いて COCO ベンチマークで検証し、mAP、FLOPs、パラメータ数を報告する。

実験結果

リサーチクエスチョン

  • RQ1バックボーン、ネック、ヘッドコンポーネントの全領域を同時にエンドツーエンドでアーキテクチャ探索することで、コンポーネント別探索に比べてオブジェクト検出性能が向上するか?
  • RQ2異なるコンポーネント(バックボーン、ネック、ヘッド)は、それぞれ異なる種類の演算を好むのか? その選好を探索効率の向上に活用できるか?
  • RQ3手作業設計されたコンポーネントと探索されたコンポーネントの不一致が、全体の検出器性能を制限するのか?
  • RQ4コンポーネント固有のサブサーチスペーススクリーニングを施した統一サーチスペースは、オブジェクト検出における標準的なNAS手法を上回る性能を発揮するか?

主な発見

  • Hit-Detector は、2700万パラメータで COCO minival で 41.4% の mAP を達成し、FPNベースライン(36.2%)および NAS-FPN + DetNAS 組み合わせ(39.4%)を上回る。
  • アブレーションスタディの結果、3つのコンポーネントを同時に探索することで最高の mAP(41.4%)が得られ、個々のコンポーネントの探索に比べて優れていることが確認された。
  • バックボーンは高い拡張率(例:ir_k3_d1_e6)を好むのに対し、ネックはより大きな受容 field を得るために大きな拡大率を好む。
  • ヘッドは、より深いまたはより表現力の高いブロック(例:ir_k5_d1_e3 や ir_k7_d1_e6)を好むことから、コンポーネント間で明確なアーキテクチャ的選好が存在することが示された。
  • 1段階検出器に拡張した場合、Hit-Detector は 3305万パラメータで 36.9% の mAP を達成し、RetinaNet(35.6%)および MobileNetV2 ベースの RetinaNet(31.5%)を上回った。
  • グループスパarsity正則化によるサブサーチスペーススクリーニングは、探索の複雑さを効果的に低減し、収束を改善することで、効率的なエンドツーエンド学習を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。