Skip to main content
QUICK REVIEW

[論文レビュー] Customizable Architecture Search for Semantic Segmentation

Yiheng Zhang, Zhaofan Qiu|arXiv (Cornell University)|Aug 26, 2019
Advanced Neural Network Applications参考文献 37被引用数 12
ひとこと要約

本論文は、ユーザーが定義した制約(推論速度やモデルサイズなど)の下で、ネットワークアーキテクチャと重みを同時に最適化する、微分可能ニューラルアーキテクチャサーチ手法であるカスタムアーキテクチャサーチ(CAS)を提案する。計算セルを微分可能DAGとしてモデル化し、コストに配慮した演算子を組み込むことで、1台のTitanXp GPUで108 FPSで推論を行い、Cityscapesで72.3%のmIoUを達成し、最先端のリアルタイム手法を精度と速度の両面で上回った。

ABSTRACT

In this paper, we propose a Customizable Architecture Search (CAS) approach to automatically generate a network architecture for semantic image segmentation. The generated network consists of a sequence of stacked computation cells. A computation cell is represented as a directed acyclic graph, in which each node is a hidden representation (i.e., feature map) and each edge is associated with an operation (e.g., convolution and pooling), which transforms data to a new layer. During the training, the CAS algorithm explores the search space for an optimized computation cell to build a network. The cells of the same type share one architecture but with different weights. In real applications, however, an optimization may need to be conducted under some constraints such as GPU time and model size. To this end, a cost corresponding to the constraint will be assigned to each operation. When an operation is selected during the search, its associated cost will be added to the objective. As a result, our CAS is able to search an optimized architecture with customized constraints. The approach has been thoroughly evaluated on Cityscapes and CamVid datasets, and demonstrates superior performance over several state-of-the-art techniques. More remarkably, our CAS achieves 72.3% mIoU on the Cityscapes dataset with speed of 108 FPS on an Nvidia TitanXp GPU.

研究の動機と目的

  • 実世界のハードウェア制約および速度制約の下で、軽量で高性能なセマンティックセグメンテーションネットワークの自動設計を実現すること。
  • 熟練した専門家による作業を要する手動設計アーキテクチャの限界を克服し、動的で変化する展開環境に柔軟に対応できること。
  • 精度、推論速度、モデルサイズのバランスを取る最適な計算セルをエンドツーエンドで探索できること。
  • 学習済みアーキテクチャの都市部(Cityscapes)とCamVidといった異なるデータセットへの一般化能力を示すこと。
  • エッジデバイスでのリアルタイム展開を支援する、カスタマイズ可能で微分可能な探索フレームワークを提供すること。

提案手法

  • ネットワークは、特徴マップをノードとし、学習可能な演算子(例:畳み込み、プーリング)をエッジとする、微分可能な有向無閉路グラフ(DAG)としてモデル化された計算セルのスタックで構成される。
  • マルチスケール特徴の統合により特徴表現を強化するため、バックボーンにマルチスケールセルが追加される。
  • 検証セット上で勾配降下を用いて、セルアーキテクチャと重みを同時に最適化する、微分可能アーキテクチャサーチ(DARTS風)の手法が用いられる。
  • 各演算子にはFLOPsやレイテンシなどのコストが割り当てられ、探索中に累積される。これにより、制約に配慮したアーキテクチャ発見が可能になる。
  • 同じセルタイプ(例:通常セルまたはリダクションセル)は同一のアーキテクチャを持つが、別々の学習済み重みを使用することで、冗長性を低減する。
  • 最終的なアーキテクチャは、探索で得られたセル構成を用いてエンドツーエンドで訓練され、リアルタイム制約のもとでCityscapesおよびCamVidで評価される。

実験結果

リサーチクエスチョン

  • RQ1ユーザーが定義した計算制約の下で、微分可能なアーキテクチャサーチ手法が、効果的に軽量なセマンティックセグメンテーションネットワークを生成できるか。
  • RQ2探索で得られたアーキテクチャの性能は、手動設計されたリアルタイムモデルと比較して、mIoUおよび推論速度の面でどのように差がつくか。
  • RQ3あるデータセット(例:Cityscapes)で学習したネットワークアーキテクチャが、別のデータセット(例:CamVid)へどの程度一般化できるか。
  • RQ4探索空間にコストに配慮した演算子を組み込むことで、精度と推論効率のトレードオフがどのように改善されるか。
  • RQ5提案されたマルチスケールセルは、計算コストを著しく増加させることなく、特徴表現を向上させることができるか。

主な発見

  • CAS-GT+MSCellは、1台のTitanXp GPUで108 FPSの推論速度を達成し、Cityscapesのテストセットで72.3%のmIoUを達成。BiSeNet-Xception39を精度と速度の両面で上回った。
  • CamVidでは、71.2%のmIoUを達成し、169 FPSで動作。BiSeNet-Res18よりもmIoUで2.5%高いが、はるかに高速であった。
  • 手動設計されたマルチスケールセルよりもmIoUが3.6%向上し、推論時間はわずか5.4ms増加にとどまり、優れた効率-精度トレードオフを実現した。
  • 探索プロセスは、正確かつ効率的なアーキテクチャを効果的に発見できており、ICNet、ENet、SQといった先行するリアルタイムモデルよりも1.0%から12.2%の性能向上を達成した。
  • CityscapesからCamVidへの学習済みアーキテクチャの転送性が確認され、本手法の一般化能力が裏付けられた。
  • コストに配慮した探索メカニズムにより、モデルサイズと速度のバランスが効果的に取られ、多様なハードウェアプラットフォームへのカスタマイズ可能な展開が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。