Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Shared Structures and Hierarchies for Multiple NLP Tasks

Junkun Chen, Kaiyu Chen|arXiv (Cornell University)|Aug 23, 2018
Topic Modeling参考文献 22被引用数 14
ひとこと要約

本論文は、自然言語処理のマルチタスク学習における最適な共有ニューラルアーキテクチャを自動で発見する強化学習ベースのコントローラーを提案する。各タスクごとに再利用可能なモジュールのプールから動的に選択する。人為的に設計された共有スキームに依存せずに、階層的かつタスク固有の構造を学習し、タスク間の関係を暗黙的にモデル化することで、テキスト分類および系列ラベル付けタスクで優れた性能を達成する。

ABSTRACT

Designing shared neural architecture plays an important role in multi-task learning. The challenge is that finding an optimal sharing scheme heavily relies on the expert knowledge and is not scalable to a large number of diverse tasks. Inspired by the promising work of neural architecture search (NAS), we apply reinforcement learning to automatically find possible shared architecture for multi-task learning. Specifically, we use a controller to select from a set of shareable modules and assemble a task-specific architecture, and repeat the same procedure for other tasks. The controller is trained with reinforcement learning to maximize the expected accuracies for all tasks. We conduct extensive experiments on two types of tasks, text classification and sequence labeling, which demonstrate the benefits of our approach.

研究の動機と目的

  • マルチタスク学習(MTL)における有効な共有アーキテクチャを手動で設計する課題に対処すること。これは時間のかかる作業であり、負の転送のリスクを伴う。
  • 固定された共有スキーム(例:ハード共有、ソフト共有、事前定義された階層的共有)の制限を克服すること。これらは複雑なタスク関係に適応できない。
  • 強化学習を用いて、多様なNLPタスクに最適なモジュールの組み合わせとスタッキング順序を自動で発見すること。
  • 特に系列ラベル付けにおいて、人為的に定義されたタスク階層に依存せずに、タスク間の階層的構造を学習すること。
  • 再設計なしに新しいデータセットやタスクの組み合わせに適応できる、スケーラブルで柔軟なMTLソリューションを提供すること。

提案手法

  • コントローラー・ネットワークが強化学習を用いて、各タスクのための共有プールからモジュールをサンプリングし、スタックしてタスク固有のアーキテクチャを構築する。
  • コントローラーはモジュールを逐次選択し、アクションはモジュールのインデックスを示し、有効なアーキテクチャが構築された後に「停止」信号を発する。
  • 方策勾配法により、全タスクの期待精度を最大化するようにコントローラーを最適化する。モデル性能に基づく微分可能な報酬信号を用いる。
  • 新規な同時オンライン更新戦略により、バッチごとにすべてのタスクで共有モジュールのパラメータを並列に更新することで、学習を高速化する。
  • アーキテクチャ探索はエンドツーエンド微分可能であり、モジュール選択とタスク固有ヘッドのパラメータを同時に最適化可能である。
  • モジュール選択シーケンスを高次元空間に可視化し、クラスタリングパターンや階層的傾向を分析する。

実験結果

リサーチクエスチョン

  • RQ1人為的に設計された共有スキームに依存せずに、強化学習コントローラーは複数のNLPタスクに適した効果的な共有モジュールアーキテクチャを自動で発見できるか?
  • RQ2ポジティブタギング、NER、SRLなどの関連するNLPタスク間で、コントローラーは意味のある階層的構造をどれほどうまく学習できるか?
  • RQ3類似したタスクは、学習済みのモジュール選択空間でどれほど密にクラスタリングされるか?これは、タスク類似性の有効な表現を示唆する。
  • RQ4本手法は、テキスト分類および系列ラベル付けのマルチタスク学習において、固定された共有スキーム(例:ハード共有やソフト共有)を上回る性能を示すか?
  • RQ5コントローラーは、アーキテクチャの再設計なしに、新しいデータセットやタスクの組み合わせに適応できるか?

主な発見

  • モデルは系列ラベル付けタスク間で階層的構造を効果的に学習しており、下位タスク(例:POSタギング)は初期のモジュールを共有し、上位タスク(例:SRL)はより深く、専用化されたモジュールを用いている。
  • 同じドメイン(例:放送ニュース対放送会話)に属するタスクは、モジュール選択空間で密にクラスタリングされており、タスク類似性の有効な表現が示されている。
  • 関連のないタスクは、関連するモジュールのみを共有することで、負の転送を回避している。
  • 本手法は、固定された共有スキームを用いたベースラインMTLモデルに比べて、テキスト分類および系列ラベル付けベンチマークで優れた性能を達成している。
  • 同時にオンライン更新戦略により、収束性と性能を維持したまま、学習が著しく高速化されている。
  • モジュール選択シーケンスの可視化により、人為的に提供された構造なしに、論理的でタスク関連の高い階層が暗黙的に学習されていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。