Skip to main content
QUICK REVIEW

[論文レビュー] Learning Versatile Neural Architectures by Propagating Network Codes

Mingyu Ding, Yuqi Huo|arXiv (Cornell University)|Mar 24, 2021
Advanced Neural Network Applications参考文献 55被引用数 8
ひとこと要約

本稿では、学習済みのニューラル予測子を介して勾配を逆伝播させることで、アーキテクチャコードを直接最適化する、複数の異種ビジョンタスクにわたる包括的で柔軟なニューラルアーキテクチャ探索手法である Network Coding Propagation (NCP) を提案する。NCP は、画像セグメンテーション、3次元検出、動画認識などのタスクを数秒で共同探索可能であり、カスタムベンチマーク (NAS-Bench-MR) および標準ベンチマーク (NAS-Bench-201) で最先端の性能を達成しており、タスク間での高い転送性を示す。

ABSTRACT

This work explores how to design a single neural network capable of adapting to multiple heterogeneous vision tasks, such as image segmentation, 3D detection, and video recognition. This goal is challenging because both network architecture search (NAS) spaces and methods in different tasks are inconsistent. We solve this challenge from both sides. We first introduce a unified design space for multiple tasks and build a multitask NAS benchmark (NAS-Bench-MR) on many widely used datasets, including ImageNet, Cityscapes, KITTI, and HMDB51. We further propose Network Coding Propagation (NCP), which back-propagates gradients of neural predictors to directly update architecture codes along the desired gradient directions to solve various tasks. In this way, optimal architecture configurations can be found by NCP in our large search space in seconds. Unlike prior arts of NAS that typically focus on a single task, NCP has several unique benefits. (1) NCP transforms architecture optimization from data-driven to architecture-driven, enabling joint search an architecture among multitasks with different data distributions. (2) NCP learns from network codes but not original data, enabling it to update the architecture efficiently across datasets. (3) In addition to our NAS-Bench-MR, NCP performs well on other NAS benchmarks, such as NAS-Bench-201. (4) Thorough studies of NCP on inter-, cross-, and intra-tasks highlight the importance of cross-task neural architecture design, i.e., multitask neural architectures and architecture transferring between different tasks. Code is available at https://github.com/dingmyu/NCP.

研究の動機と目的

  • 異なるデータ分布と特徴の粒度要件を有する複数の異種ビジョンタスクをサポートできる統一されたニューラルアーキテクチャ探索空間の設計。
  • タスクおよびデータセットの不一致を解消するため、多様なタスクにわたる共同最適化を可能にする、マルチタスクニューラルアーキテクチャ探索における課題の解決。
  • 各タスクごとに再訓練や繰り返し探索を実行せずに、効率的に多様なタスクにわたる包括的アーキテクチャを探索する手法の開発。
  • 共有ネットワークコードとマルチタスク予測子学習を活用することで、タスク間でのアーキテクチャ転送を促進。
  • 既存のNASベンチマークと実世界のマルチタスクシナリオのギャップを埋めるために、ImageNet、Cityscapes、KITTI、HMDB51 を用いた実用的ベンチマークである NAS-Bench-MR の導入。

提案手法

  • すべてのネットワークハイパーパramータを離散的コード(例:3ブロック、1ブロックあたり2つの残差ユニット、64チャネル → '3,2,64')として表現し、マルチタスク探索用の統一コード空間を構築。
  • 各タスクごとにタスク固有のニューラル予測子を訓練し、ネットワークコードを性能指標(例:正確度、mIoU、FLOPs)にマップする。
  • ニューラル予測子から勾配を逆伝播させ、ターゲットの性能制約(例:高い正確度、低いFLOPs)に沿ってアーキテクチャコードを直接最適化。
  • コード空間における勾配ベース最適化により、巨大な探索空間を効率的に走査し、数秒で収束を達成。
  • あるタスクのコードを初期値として用い、別のタスクの予測子を用いて微調整することで、タスク間でのアーキテクチャ転送を可能に。
  • 複数の予測子にわたる勾配の蓄積としてマルチタスク目的を定式化し、正確度と効率性といった相反する目標を同時に最適化可能に。

実験結果

リサーチクエスチョン

  • RQ1異なるデータ分布と表現ニーズを有する複数の異種ビジョンタスクに、1つのニューラルアーキテクチャを効果的に最適化できるか?
  • RQ2各タスクごとに探索プロセスを再実行せずに、多様なタスクにわたる効率的かつスケーラブルなアーキテクチャ探索は可能か?
  • RQ3あるタスクで学習したアーキテクチャコードが、最小限の再トレーニングで別のタスクにどの程度転送可能か?
  • RQ4統一された探索空間の設計が、マルチタスクアーキテクチャの一般化性および性能に与える影響は何か?
  • RQ5コード空間における勾配ベース最適化が、複数のタスクにわたる高速かつアーキテクチャ駆動の探索をどのように可能にするか?

主な発見

  • NCP は、データ依存の探索を回避するため、ニューラル予測子を通じた勾配の逆伝播により、ネットワークコードを直接最適化することで、数秒で最適なアーキテクチャ構成を達成する。
  • 提案された NAS-Bench-MR ベンチマークにより、ImageNet、Cityscapes、KITTI、HMDB51 を含む実世界のデータセット上で、実用的で大規模なマルチタスクNASが可能になった。
  • NCP は高い転送性を示す:ターゲットタスクの予測子を用いて数回のイテレーションで新しいタスクにアーキテクチャを適応可能に。
  • 異なるタスクからのアーキテクチャコードには明確なパターンが見られる — 例:セグメンテーションモデルでは、4段階目の4番目のブランチでチャネル幅が増加するが、分類モデルでは減少する。
  • NAS-Bench-201 で最先端の性能を達成し、従来のNAS手法に比べてマルチタスクおよび転移学習のシナリオでも優れた性能を示す。
  • 可視化結果から、タスクごとにモデル設計が顕著に異なることが明らかになった — セグメンテーションは融合モジュールを多く採用し、並列ユニットを減らす傾向があるが、動画認識では中間的なチャネル設定を維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。