Skip to main content
QUICK REVIEW

[論文レビュー] Flexible Multi-task Networks by Learning Parameter Allocation

Krzysztof Maziarz, Efi Kokiopoulou|arXiv (Cornell University)|Oct 10, 2019
Domain Adaptation and Few-Shot Learning参考文献 31被引用数 8
ひとこと要約

本稿では、Gumbel-Softmax再パrameterizationを用いて微分可能なバイナリ割り当て変数により、細粒度なパラメータ共有パターンを学習する柔軟なマルチタスク学習フレームワークを提案する。タスク固有のコンポonent割り当てとモデルパラメータを同時に最適化することで、最先端手法と比較してOmniglotで17%の相対的誤差低減を達成し、タスクの類縁度に応じて共有を動的に適応する。

ABSTRACT

This paper proposes a novel learning method for multi-task applications. Multi-task neural networks can learn to transfer knowledge across different tasks by using parameter sharing. However, sharing parameters between unrelated tasks can hurt performance. To address this issue, we propose a framework to learn fine-grained patterns of parameter sharing. Assuming that the network is composed of several components across layers, our framework uses learned binary variables to allocate components to tasks in order to encourage more parameter sharing between related tasks, and discourage parameter sharing otherwise. The binary allocation variables are learned jointly with the model parameters by standard back-propagation thanks to the Gumbel-Softmax reparametrization method. When applied to the Omniglot benchmark, the proposed method achieves a 17% relative reduction of the error rate compared to state-of-the-art.

研究の動機と目的

  • タスクが無関係である場合に発生する負の転送(shared parameters が個々のタスクの性能を低下させる現象)を解消すること。
  • 固定または手動で設計された共有パターンに依存せず、タスクの類縁度を反映した自動的かつ適応的なパラメータ共有を可能にすること。
  • ネットワークコンポーネント across におけるバイナリ割り当てパターンの集約を通じて、スパースで解釈可能なタスク埋め込みを学習すること。
  • 標準的なバックプロパゲーションを用いて、モデルパラメータと割り当て意思決定を同時に最適化することにより、高価な探索やヒューリスティックチューニングを回避すること。

提案手法

  • 各ネットワークレイヤーを再利用可能なコンポーネント(例:畳み込みフィルタ)の集合としてモデル化し、各コンポーネントを学習可能なバイナリ割り当て変数によってタスクに割り当てる。
  • バイナリ割り当て変数はGumbel-Softmax再パラメータ化により微分可能であり、標準的なバックプロパゲーションを用いたエンドツーエンド学習を可能にする。
  • 温度制御されたGumbel-Softmaxを用いた予算制約により、コンポーネント割り当てにおけるスパarsityを促進し、効率的で解釈可能な共有を推奨する。
  • タスク固有のヘッドを割り当てられたコンポーネントの出力に接続し、各タスクがネットワークのコンポーネントの固有のサブセットを用いることを可能にする。
  • 割り当てのログィットは、タスク固有の損失とスパarsity正則化をバランスさせる目的関数を用いて、モデル重みと同時に訓練される。
  • 訓練後、各タスクごとにバイナリ割り当てベクトルが抽出され、タスクの類縁度を反映するスパースな埋め込みが形成される。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークは、タスクの類縁度に応じてコンポーネントを動的に割り当てられ、固定共有パターンよりも性能を向上させることができるか?
  • RQ2本手法は、タスクが無関係である場合に、負の転送を緩和するか?
  • RQ3学習されたバイナリ割り当てパターンは、潜在的なタスク類似度を反映する意味的で解釈可能なタスク埋め込みを形成できるか?
  • RQ4さまざまな程度のタスク類縁度を有するベンチマークにおいて、本手法は強力なベースラインおよび最先端手法と比較してどうなるか?
  • RQ5本フレームワークは、タスクの構成を事前に知らずに、マルチタスクデータセットにおける隠れた構造(例:関連タスクのクラスタリング)を発見できるか?

主な発見

  • Omniglotベンチマークにおいて、本手法は最先端手法と比較して17%の相対的誤差低減を達成し、優れた一般化性能を示した。
  • 合成実験では、無関係なタスク(ρ=0)においても負の転送を効果的に回避し、「共有ボトム」と「共有なし」の両パターンを上回った。
  • 学習されたバイナリ割り当てベクトルは、スパースで解釈可能な埋め込みを形成し、既知のタスククラスタを反映していた:すべてのMNISTタスクは同一の埋め込みを取得し、Fashion-MNISTタスクも同様にグループ化された。
  • タスク埋め込みのペアワイズコサイン類似度は、3つのクラスタ(CIFAR、MNIST、Fashion-MNIST)を明確に分離しており、MNISTとFashion-MNISTの類縁度がCIFARと比較して高いことが示された。
  • CIFAR-100クラスタ内では多様な割り当てパターンが学習され、類縁度内での多様性を捉えている一方で、他のクラスタとは明確に分離されていた。
  • 本フレームワークは、訓練中にタスクの構成を参照せず、タスクIDのみに依存してタスク構造を発見可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。