Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Neural Architecture Transformation Searchin Channel-Level for Object Detection

Junran Peng, Ming Sun|arXiv (Cornell University)|Sep 5, 2019
Advanced Neural Network Applications参考文献 46被引用数 10
ひとこと要約

本稿では、畳み込みの膨張率を用いてチャンネルレベルの変換を探索することで、事前学習済みの画像分類ネットワークをオブジェクト検出に適応する勾配ベースのニューラルアーキテクチャ変換探索手法NATSを提案する。学習段階と再訓練段階の両方でImageNet事前学習重みを再利用することにより、追加のパラメータやFLOPsを追加せずにCOCOで最大2.0%のAP向上を達成し、リアルタイム検出システムにおける効率的でハードウェアにやさしい展開を可能にする。

ABSTRACT

Recently, Neural Architecture Search has achieved great success in large-scale image classification. In contrast, there have been limited works focusing on architecture search for object detection, mainly because the costly ImageNet pre-training is always required for detectors. Training from scratch, as a substitute, demands more epochs to converge and brings no computation saving. To overcome this obstacle, we introduce a practical neural architecture transformation search(NATS)algorithm for object detection in this paper. Instead of searching and constructing an entire network, NATS explores the architecture space on the base of existing network and reusing its weights. We propose a novel neural architecture search strategy in channel-level instead of path-level and devise a search space specially targeting at object detection. With the combination of these two designs, an architecture transformation scheme could be discovered to adapt a network designed for image classification to task of object detection. Since our method is gradient-based and only searches for a transformation scheme, the weights of models pretrained inImageNet could be utilized in both searching and retraining stage, which makes the whole process very efficient. The transformed network requires no extra parameters and FLOPs, and is friendly to hardware optimization, which is practical to use in real-time application. In experiments, we demonstrate the effectiveness of NATSon networks like ResNet and ResNeXt. Our transformed networks, combined with various detection frameworks, achieve significant improvements on the COCO dataset while keeping fast.

研究の動機と目的

  • 訓練からオブジェクト検出器を学習するか、事前学習なしで大規模なバックボーンを微調整する際の非効率性を解消すること。
  • 画像分類とオブジェクト検出のギャップを埋めるために、タスク固有のアーキテクチャ探索空間を設計すること。
  • 学習段階と再訓練段階の両方でImageNet事前学習重みを再利用する効率的で勾配ベースのアーキテクチャ探索を実現すること。
  • 追加のパラメータやFLOPsを追加せずに、既存のバックボーンを変換することでCOCOにおけるオブジェクト検出性能を向上させること。
  • チャンネルレベルの操作と膨張パターンに焦点を当てた探索戦略を構築し、マルチスケールオブジェクト検出に適した有効受容 field の拡大を図ること。

提案手法

  • 各パスの特徴マップをチャンネル単位のサブパスに分割し、それぞれを探索可能なユニットとして扱うチャンネルレベルの探索戦略を提案する。
  • 複数の膨張率を用いた膨張畳み込みに基づく探索空間を設計し、カーネルサイズを変更せずに有効受容 field を拡大する。
  • 微分可能で勾配ベースの探索を用いて、既存のネットワーク構造を再構成する最適な変換スキームを発見する。
  • 学習段階と再訓練段階の両方でImageNet事前学習重みを再利用し、高価な事前学習や追加パラメータの必要性を排除する。
  • ResNet や ResNeXt などの既存のバックボーンに学習済み変換スキームを適用し、最小限の計算コストでオブジェクト検出に適応させる。
  • チャンネル単位の特徴フローにおける構造的変更に重点を置いた探索戦略を採用し、高性能な構成の効率的探索を可能にする。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み画像分類ネットワークを、再訓練なしに効率的にオブジェクト検出に適応できる勾配ベースのアーキテクチャ探索手法を設計できるか?
  • RQ2オブジェクト検出の要件、特にマルチスケールオブジェクトの変動への対処を考慮して、探索空間を再定義できるか?
  • RQ3膨張操作による有効受容 field (ERF) の拡大が、検出性能にどの程度の向上効果をもたらすか?
  • RQ4変換ベースのアプローチが、パラメータやFLOPsを追加せずに顕著な性能向上を達成できるか?
  • RQ5学習済みアーキテクチャ変換は、異なる検出フレームワークやバックボーンの深さに一般化できるか?

主な発見

  • NATSは、ResNet-50を搭載したFaster R-CNNをCOCOで2.0%のAP向上、ResNet-101では1.8%のAP向上を達成し、パラメータやFLOPsを追加せずに実現した。
  • 同じ変換バックボーンを用いて、Mask R-CNNでは1.9%、Cascade R-CNNでは1.3%、RetinaNetでは1.3%のAP向上を達成した。
  • 探索プロセスは8×1080Ti GPUで2.5日間で完了し、再訓練にはたった1日間で完了する。これはベースラインモデルを学習するのと同等の時間である。
  • 変換済みネットワークは、より大きく、より頑健な有効受容 field (ERF) を示しており、中心部の強度が強く、外周部のカバー範囲も良好である。
  • より深いモデルにも一般化可能である:ResNeXt-101では1.1%のAP向上を達成し、特に大規模オブジェクトAP (AP_L) においてより深いネットワークがより大きな利益を得た。
  • アスペクト比の異なる膨張候補(例:(1,3)、(3,1))は、均一な候補よりも0.4%の性能向上を示し、ERFの多様性の重要性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。