Skip to main content
QUICK REVIEW

[論文レビュー] AutoMTL: A Programming Framework for Automating Efficient Multi-Task Learning

Lijun Zhang, Xiao Liu|arXiv (Cornell University)|Oct 25, 2021
Advanced Neural Network Applications被引用数 5
ひとこと要約

AutoMTL は、任意のバックボーン CNN をオペレータレベルのパラメータ共有によるマルチタスクスーパーモデルにコンパイルすることで、効率的なマルチタスク学習(MTL)を自動化するプログラミングフレームワークである。勾配ベースのアーキテクチャ探索と正則化を用い、高いタスク精度と低いメモリ使用量を同時に最適化し、CityScapes、NYUv2、Tiny-Taskonomy ベンチマークで最先端の手法を上回る性能を達成した。

ABSTRACT

Multi-task learning (MTL) jointly learns a set of tasks by sharing parameters among tasks. It is a promising approach for reducing storage costs while improving task accuracy for many computer vision tasks. The effective adoption of MTL faces two main challenges. The first challenge is to determine what parameters to share across tasks to optimize for both memory efficiency and task accuracy. The second challenge is to automatically apply MTL algorithms to an arbitrary CNN backbone without requiring time-consuming manual re-implementation and significant domain expertise. This paper addresses the challenges by developing the first programming framework AutoMTL that automates efficient MTL model development for vision tasks. AutoMTL takes as inputs an arbitrary backbone convolutional neural network (CNN) and a set of tasks to learn, and automatically produces a multi-task model that achieves high accuracy and small memory footprint simultaneously. Experiments on three popular MTL benchmarks (CityScapes, NYUv2, Tiny-Taskonomy) demonstrate the effectiveness of AutoMTL over state-of-the-art approaches as well as the generalizability of AutoMTL across CNNs. AutoMTL is open-sourced and available at https://github.com/zhanglijun95/AutoMTL.

研究の動機と目的

  • モデルサイズとタスク精度のバランスをとったリソース効率の良い MTL アーキテクチャの設計という課題に対処すること。
  • バックボーンネットワークを変更する際の MTL アルゴリズムの手動再実装の必要性を排除すること。
  • 機械学習の専門知識がなくても一般のプログラマーや実務家が簡単に MTL を活用できるようにすること。
  • 分離可能で自動化されたコンパイルパイプラインを通じて、任意の CNN バックボーンをサポートすること。
  • タスクの複雑さや干渉の度合いに応じて適応可能な柔軟でスケーラブルなアーキテクチャ探索空間を提供すること。

提案手法

  • マルチタスクスーパーモデルコンパイラー(MTS-Compiler)は、各オペレータをパラメータ共有の基本単位として扱い、ユーザーが提供する CNN バックボーンをマルチタスクスーパーモデルに変換する。
  • バーチャルコンピュテーションノードを用いてエンコードされたスケーラブルなアーキテクチャ探索空間により、タスクの要件に応じて動的にモデル容量を調整できる。
  • 微分可能なアーキテクチャ探索を備えたポリシー・ネットワークを訓練し、最適な共有パターンを決定する。正則化損失を用いてパラメータ共有の度合いを制御する。
  • 正則化ハイパーパramータ λreg は、モデルのコンactness とタスクパフォーマンスのトレードオフを制御する。
  • 再実装を必要とせず、ソース・ツー・ソースのコンパイルアプローチを活用することで、任意の CNN バックボーンをサポートする。
  • PyTorch API を介して実装されており、0.6 秒未満でシームレスに統合され、自動的にスーパーモデルが生成される。

実験結果

リサーチクエスチョン

  • RQ1任意の CNN バックボーンに対して手動での再実装を伴わずに、効率的な MTL モデル開発をプログラミングフレームワークが自動化できるか?
  • RQ2レイヤー単位の共有と比較して、オペレータレベルのパラメータ共有はモデルサイズとタスク精度のトレードオフをどのように改善できるか?
  • RQ3コンパイラー基盤のスーパーモデル変換により、アーキテクチャ探索とバックボーン設計を分離でき、アクセス性が向上するか?
  • RQ4スケーラブルなアーキテクチャ探索空間は、多様なベンチマークおよびバックボーンモデルにおいてどのように性能を発揮するか?
  • RQ5λreg などの正則化ハイパーパramータは、学習されたマルチタスクモデルにおける精度とコンパクトネスのトレードオフをどの程度制御できるか?

主な発見

  • CityScapes において、MNasNet を使用した場合、AutoMTL は単一タスクベースライン比でタスク精度をそれぞれ +17.1% と +13.2% まで向上させ、パラメータ数を 35.9% 減少させた。
  • CityScapes では、AutoMTL が単一タスクベースライン比で 33.5% 少ないパラメータ数でマルチタスクモデルを生成した一方、MobileNetV2 ベースライン比で相対的に 7.4% の性能向上を達成した。
  • λreg = 0.0005 の場合、AutoMTL はモデルパラメータ数を 0.018M(ベースラインの 33%)にまで削減しながら、70.0% の mIoU、86.6% の深度精度、93.4% の表面法線精度を維持した。
  • ポリシーの可視化から、セマンティックセグメンテーションは深度推定よりも多くのオペレータを共有しており、深度推定ではスキップ接続が多用されていることがわかった。これはタスク固有のコンパクトネスの好みを示している。
  • MTS-Compiler は任意のバックボーン CNN を約 0.6 秒でスーパーモデルにコンパイルした。一方、最先端の NAS に基づく MTL 手法(Adashare)を再実装するには熟練のユーザーでも 20~40 時間を要した。
  • AutoMTL は CityScapes、NYUv2、Tiny-Taskonomy において MobileNetV2、MNasNet、ResNet-18 すべてで効果的に一般化し、広範な適用可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。