Skip to main content
QUICK REVIEW

[論文レビュー] EAutoDet: Efficient Architecture Search for Object Detection

Xiaoxing Wang, Jiale Lin|arXiv (Cornell University)|Mar 21, 2022
Advanced Neural Network Applications被引用数 4
ひとこと要約

EAutoDetは、カーネル再利用と動的チャネル精錬を用いて、1.4 GPU日でバックボーンとFPNアーキテクチャを同時に最適化する効率的な微分可能ニューラルアーキテクチャ探索フレームワークを提案する。ImageNetの事前学習を一切行わず、COCOで120 FPSで40.1 mAP、41.3 FPSで49.2 mAPを達成し、先行するNAS手法を上回る性能を発揮する。

ABSTRACT

Training CNN for detection is time-consuming due to the large dataset and complex network modules, making it hard to search architectures on detection datasets directly, which usually requires vast search costs (usually tens and even hundreds of GPU-days). In contrast, this paper introduces an efficient framework, named EAutoDet, that can discover practical backbone and FPN architectures for object detection in 1.4 GPU-days. Specifically, we construct a supernet for both backbone and FPN modules and adopt the differentiable method. To reduce the GPU memory requirement and computational cost, we propose a kernel reusing technique by sharing the weights of candidate operations on one edge and consolidating them into one convolution. A dynamic channel refinement strategy is also introduced to search channel numbers. Extensive experiments show significant efficacy and efficiency of our method. In particular, the discovered architectures surpass state-of-the-art object detection NAS methods and achieve 40.1 mAP with 120 FPS and 49.2 mAP with 41.3 FPS on COCO test-dev set. We also transfer the discovered architectures to rotation detection task, which achieve 77.05 mAP$_{ ext{50}}$ on DOTA-v1.0 test set with 21.1M parameters.

研究の動機と目的

  • 既存のNAS手法がオブジェクト検出において高い計算コストとメモリ使用量を生じる主な要因(大規模データセットと複雑なモデル)に対処すること。
  • ImageNetでの事前学習を一切行わず、バックボーンとFPNモジュールのエンドツーエンドで統合的なアーキテクチャ探索を可能にすること。
  • GPUメモリと学習時間を削減しながら、高い探索精度とモデル性能を維持すること。
  • NASとYOLOスタイルのワンステージ検出器の組み合わせの可能性を調査すること。これは高速ではあるが、その複雑な手作業設計のため、従来のNASでは改善が難しい。

提案手法

  • 微分可能探索戦略を用いて、バックボーンとFPNモジュールを同時にモデル化する1つのスーパーネットを構築する。
  • 同じエッジ上の候補演算の間で重みを共有することで、カーネル再利用を導入し、1つの畳み込みに統合することで、メモリと計算量を削減する。
  • トレーニング中に最適なチャネル数を動的に調整する動的チャネル精錬を採用し、収束性と効率性を向上させる。
  • マクロ探索空間を用いて、C3ブロック、ボトルネック、FPN融合ブロックを独立して最適化し、演算、チャネル数、接続の細分化された探索を可能にする。
  • ImageNet事前学習を一切行わず、MS-COCO上でスーパーネットをスクラッチからトレーニングすることで、探索コストを顕著に低減する。
  • 2ストリーム最適化を適用:SGDを用いて50エポックにわたり、アーキテクチャパラメータとネットワーク重みを交互に更新する。

実験結果

リサーチクエスチョン

  • RQ1ImageNetでの事前学習を一切行わず、検出データセット上でバックボーンとFPNアーキテクチャの統合的探索を効率的に行うことは可能か?
  • RQ2カーネル再利用と動的チャネル精錬は、オブジェクト検出のスーパーネットトレーニングにおいて、GPUメモリと学習時間をどのように削減できるか?
  • RQ3YOLOスタイルのワンステージ検出器にNASを適用することで、手作業設計のYOLOモデルを上回る精度を達成しつつ、高い推論速度を維持できるか?
  • RQ4最小限の探索コストでCOCO検出に直接適用した場合、NASの性能の上限はどの程度か?
  • RQ5発見されたアーキテクチャは、回転検出などの他の検出タスクへも一般化可能か?

主な発見

  • EAutoDetは、1台のV100 GPUで1.4 GPU日間でのみオブジェクト検出モデルを発見し、従来の数十~数百度GPU日を要する手法と比べて、顕著に探索コストを削減した。
  • 発見されたAutoYOLO-sモデルは、COCO test-devで120 FPSで40.1 mAPを達成し、パラメータ数が少なく、速度も速いYOLOv5-s(36.9 mAP)を上回った。
  • AutoYOLO-xモデルは、41.3 FPSで49.2 mAPを達成し、わずかに少ないFLOPsとパラメータ数でYOLOv5-x(49.1 mAP)を上回った。
  • この手法により、ImageNet事前学習を一切行わず、COCO上でスクラッチから直接トレーニングが可能となり、高コストな事前学習の必要性が排除され、探索効率が向上した。
  • DOTA-v1.0の回転検出タスクに転移した場合、AutoYOLOモデルは21.1Mパラメータで77.05 mAP50を達成し、優れた一般化性能を示した。
  • 探索空間は非常に表現力が高く、演算、チャネル倍率、接続の細分化された探索が可能であり、FPNブロック1つあたり5.4×10^8種類以上の候補接続タイプをカバーしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。