Skip to main content
QUICK REVIEW

[論文レビュー] MTL-NAS: Task-Agnostic Neural Architecture Search towards General-Purpose Multi-Task Learning

Yuan Gao, Haoping Bai|arXiv (Cornell University)|Mar 31, 2020
Domain Adaptation and Few-Shot Learning参考文献 72被引用数 9
ひとこと要約

MTL-NASは、タスクに依存しないニューラルアーキテクチャサーチフレームワークを提案し、一般用途のマルチタスク学習(GP-MTL)に適応するため、タスク固有のバックボーンを階層的・レイヤーワイズな特徴統合機構から分離する。クロスタスク接続の統一された探索空間と、最小エントロピー正則化を施したワンショット勾配ベースの探索を導入することで、再訓練を伴わずに探索されたアーキテクチャを直接展開可能とし、多様なタスクセットとバックボーンにおいて最先端の性能を達成する。

ABSTRACT

We propose to incorporate neural architecture search (NAS) into general-purpose multi-task learning (GP-MTL). Existing NAS methods typically define different search spaces according to different tasks. In order to adapt to different task combinations (i.e., task sets), we disentangle the GP-MTL networks into single-task backbones (optionally encode the task priors), and a hierarchical and layerwise features sharing/fusing scheme across them. This enables us to design a novel and general task-agnostic search space, which inserts cross-task edges (i.e., feature fusion connections) into fixed single-task network backbones. Moreover, we also propose a novel single-shot gradient-based search algorithm that closes the performance gap between the searched architectures and the final evaluation architecture. This is realized with a minimum entropy regularization on the architecture weights during the search phase, which makes the architecture weights converge to near-discrete values and therefore achieves a single model. As a result, our searched model can be directly used for evaluation without (re-)training from scratch. We perform extensive experiments using different single-task backbones on various task sets, demonstrating the promising performance obtained by exploiting the hierarchical and layerwise features, as well as the desirable generalizability to different i) task sets and ii) single-task backbones. The code of our paper is available at https://github.com/bhpfelix/MTLNAS.

研究の動機と目的

  • 既存のNAS手法がタスク固有であり、一般用途のマルチタスク学習(GP-MTL)と互換性がないという制限に対処すること。
  • GP-MTLにおけるタスク固有の事前知識を特徴共有/統合機構から分離し、統一的かつタスクに依存しない探索空間を実現すること。
  • ワンショットNASにおける探索段階と最終評価段階の性能ギャップを、アーキテクチャ重みの不確実性を最小化することで是正すること。
  • 再訓練なしに探索されたアーキテクチャを直接展開可能とし、効率性と実用性を向上させること。

提案手法

  • GP-MTLを固定されたタスク固有の単一タスクバックボーンと、それらの間で階層的・レイヤーワイズに特徴を統合する汎用的な機構に分解する。
  • 固定されたバックボーン層の間に探索可能なクロスタスクエッジ(特徴統合接続)を挿入することで、タスクに依存しない探索空間を定義する。
  • アーキテクチャ重みに最小エントロピー正則化を施したワンショット勾配ベースの探索アルゴリズムを提案し、近似的に離散値に収束するよう促進する。
  • DARTSおよびSNASを一般化する統一フレームワーク内に、決定論的または確率的連続的緩和と離散化のコンponentを統合する。
  • エントロピー最小化によりアーキテクチャ重みの不確実性を低減し、探索後に安定的かつ高性能な離散的アーキテクチャが得られることを保証する。
  • 再訓練なしに探索されたアーキテクチャを直接評価可能とし、推論コストを顕著に削減する。

実験結果

リサーチクエスチョン

  • RQ1任意のタスクの組み合わせをサポートできる統一的かつタスクに依存しない探索空間をマルチタスク学習に設計可能か?
  • RQ2ワンショットNASにおいて、探索段階と最終評価段階の性能ギャップをどのように是正できるか?
  • RQ3エントロピー最小化は、再訓練なしに近似的に離散的な解を得るために有効にアーキテクチャ重みを正則化できるか?
  • RQ4提案手法は、GP-MTLにおける異なる単一タスクバックボーンとタスクセットに一般化可能か?
  • RQ5再訓練なしに探索されたアーキテクチャを直接展開して評価可能であり、高い性能を維持できるか?

主な発見

  • 提案手法は、表面法線推定とセマンティックセグメンテーションを含む複数のタスクセットで最先端の性能を達成し、CityscapesデータセットではmIoUが88.2%、PAccが91.2%を達成した。
  • 最小エントロピー正則化はアーキテクチャ重みを効果的に正則化し、収束したα値のヒストограмから、多数のα値が0または1に収束していることが示された。
  • 探索段階と評価段階の性能ギャップが是正された:再訓練なしに、Cityscapesデータセットで平均IoUが37.7%、mIoUが67.9%を達成した。
  • 決定論的および確率的コンponent(緩和と離散化)の異なる組み合わせにおいて、エントロピー正則化下で性能差は無視できるほど小さく、ロバストネスと安定性を示した。
  • 学習されたアーキテクチャは非均質的かつ非対称的であり、手動で発見するのは非自明であることが示され、本手法が複雑で効果的な構造を効果的に発見できることを裏付けた。
  • アブレーションスタディにより、最小エントロピー正則化が連続的緩和と離散化のあらゆる設定において性能を顕著に向上させ、DARTSおよびSNASを上回ることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。