[論文レビュー] FBNetV5: Neural Architecture Search for Multiple Tasks in One Run
FBNetV5 は、1回の探索実行で複数のコンピュータビジョンタスク(画像分類、オブジェクト検出、セマンティックセグメンテーション)のための効率的で高性能なモデルを同時に発見するニューラルアーキテクチャサーチフレームワークである。統合的でマルチリゾリューションなスーパーネットと学習可能なバイナリマスク、マルチタスクプロキシ学習目的関数を用い、タスク固有のパイプライン統合を必要とせず、大幅に削減された探索コストで最先端の精度を達成する。
Neural Architecture Search (NAS) has been widely adopted to design accurate and efficient image classification models. However, applying NAS to a new computer vision task still requires a huge amount of effort. This is because 1) previous NAS research has been over-prioritized on image classification while largely ignoring other tasks; 2) many NAS works focus on optimizing task-specific components that cannot be favorably transferred to other tasks; and 3) existing NAS methods are typically designed to be "proxyless" and require significant effort to be integrated with each new task's training pipelines. To tackle these challenges, we propose FBNetV5, a NAS framework that can search for neural architectures for a variety of vision tasks with much reduced computational cost and human effort. Specifically, we design 1) a search space that is simple yet inclusive and transferable; 2) a multitask search process that is disentangled with target tasks' training pipeline; and 3) an algorithm to simultaneously search for architectures for multiple tasks with a computational cost agnostic to the number of tasks. We evaluate the proposed FBNetV5 targeting three fundamental vision tasks -- image classification, object detection, and semantic segmentation. Models searched by FBNetV5 in a single run of search have outperformed the previous stateof-the-art in all the three tasks: image classification (e.g., +1.3% ImageNet top-1 accuracy under the same FLOPs as compared to FBNetV3), semantic segmentation (e.g., +1.8% higher ADE20K val. mIoU than SegFormer with 3.6x fewer FLOPs), and object detection (e.g., +1.1% COCO val. mAP with 1.2x fewer FLOPs as compared to YOLOX).
研究の動機と目的
- 画像分類を超える新しいコンピュータビジョンタスクにNASを適用する際の人的・計算的コストの高さに対処すること。
- 異なるビジョンタスク間で転送不能なタスク固有のNAS手法の限界を克服すること。
- NASの探索プロセスをターゲットタスクのトレーニングパイプラインから分離することで、スケーラビリティと再利用性を向上させること。
- タスク数に依存しない計算コストを持つ探索アルゴリズムを開発し、効率的なマルチタスクアーキテクチャ探索を可能にすること。
- タスク固有の再チューニングなしに、1回の探索実行で多様なビジョンタスクにおいて最先端のモデルを発見できることを実証すること。
提案手法
- HRNetをインspiredに、並列パスを持つマルチリゾリューションスーパーネットに基づく、シンプルでありながら包括的かつ転送可能な探索空間を設計する。
- スーパーネット内でのアーキテクチャ選択(保留/削除ブロック)を表すために学習可能なバイナリマスクを採用し、微分可能アーキテクチャサーチを可能にする。
- ImageNetから抽出したプロキシマルチタスクデータセット(事前学習モデルから生成された合成検出・セグメンテーションラベルを含む)を用いて探索を実施する。
- 1つのスーパーネットを同時に複数のタスクに最適化する新しいマルチタスク探索アルゴリズム(アルゴリズム4)を導入し、タスク数に依存しない探索コストを実現する。
- 固定されたプロキシデータセットと損失関数を用いることで、探索プロセスをターゲットタスクのトレーニングパイプラインから分離し、下流のトレーニングに干渉しないようにする。
- タスク間で共有されるスーパーネットと共有パラメータを用いることで、1回のトレーニング実行で複数の目的に対する効率的なアーキテクチャサーチを実現する。
実験結果
リサーチクエスチョン
- RQ11回のNASフレームワークで、タスク固有のパイプライン統合を必要とせずに、複数のビジョンタスク(分類、検出、セグメンテーション)に対して効率的かつ高性能なアーキテクチャを同時に発見できるか?
- RQ2マルチリゾリューションパスと共有パラメータを持つ統合的探索空間は、分類、検出、セグメンテーションといった多様なタスク間で、転送可能で効果的なアーキテクチャを可能にするか?
- RQ3マルチタスク探索アルゴリズムは、タスク数に比例する要因で削減された探索コストを実現しながら、単一タスク探索と同等またはそれ以上の性能を達成できるか?
- RQ4共同探索によって発見されたモデルの性能は、複数のベンチマークにおいて、精度、FLOPs、推論効率の観点でSOTAモデルと比較してどうなるか?
- RQ5提案されたフレームワークは、再トレーニングや再構成なしに、新しいタスクに対するスケーラブルなNASを可能にするか?
主な発見
- 同じFLOPs条件下で、ImageNet分類タスクにおいてFBNetV3より1.3%高いトップ1精度を達成し、優れた効率-精度トレードオフを示している。
- ADE20Kにおけるセマンティックセグメンテーションでは、SegFormerと比較して1.8%高いmIoUを達成しながら、FLOPsを3.6倍も削減しており、顕著な効率性の向上を示している。
- COCOにおけるオブジェクト検出では、YOLOXと比較してmAPを1.1%向上させつつ、FLOPsを1.2倍削減しており、低い計算量で高い性能を発揮している。
- マルチタスク探索アルゴリズムにより、単一タスク探索と比較して探索コストがタスク数Tの割合で削減され、性能は維持または向上している。
- 分類タスク向けに探索されたアーキテクチャは、非順序的でマルチリゾリューションなブロックパターンを示しており、従来の順次スタックとは異なる新しい設計方向性を示唆している。
- 同じ探索空間内でランダムサーチも強力なベースライン性能を示すが、FBNetV5のマルチタスク探索は、全タスクで0.3~1.6ポイントの優位性を一貫して示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。