Skip to main content
QUICK REVIEW

[論文レビュー] Multi-task Learning with Multi-head Attention for Multi-choice Reading Comprehension

Hui Wan|arXiv (Cornell University)|Feb 26, 2020
Topic Modeling参考文献 11被引用数 9
ひとこと要約

本稿では、DREAMデータセットにおける多選択読解のため、Albert-xxlargeと二重マルチヘッド相互注意(DUMA)モジュールを用いたマルチタスク学習アプローチを提案する。DREAMとRACEデータセットを同時に学習することで、文脈形式の違い(会話形式対本文形式)にもかかわらず、一般化性能と知識の転送が向上し、91.8%という新たなSOTAテスト精度を達成した。

ABSTRACT

Multiple-choice Machine Reading Comprehension (MRC) is an important and challenging Natural Language Understanding (NLU) task, in which a machine must choose the answer to a question from a set of choices, with the question placed in context of text passages or dialog. In the last a couple of years the NLU field has been revolutionized with the advent of models based on the Transformer architecture, which are pretrained on massive amounts of unsupervised data and then fine-tuned for various supervised learning NLU tasks. Transformer models have come to dominate a wide variety of leader-boards in the NLU field; in the area of MRC, the current state-of-the-art model on the DREAM dataset (see[Sunet al., 2019]) fine tunes Albert, a large pretrained Transformer-based model, and addition-ally combines it with an extra layer of multi-head attention between context and question-answer[Zhuet al., 2020].The purpose of this note is to document a new state-of-the-art result in the DREAM task, which is accomplished by, additionally, performing multi-task learning on two MRC multi-choice reading comprehension tasks (RACE and DREAM).

研究の動機と目的

  • DREAMデータセットにおける多選択読解タスクの性能向上を図ること。DREAMは比較的小さく、挑戦的なデータセットである。
  • より大きな関連する多選択MRCデータセット(RACE)からの知識転送が、DREAMにおける一般化性能と性能向上に寄与するかどうかを調査すること。
  • 異なる文脈形式(会話形式対本文形式)を持つ2つの類縁なMRCタスクにおいて、共通のモデルアーキテクチャを用いたマルチタスク学習の有効性を評価すること。
  • マルチヘッドアテンション機構(DUMA)が、共同学習環境下で文脈、質問、選択肢の間の推論をどのように向上させるかを検証すること。

提案手法

  • DREAMおよびRACEデータセットの両方の主エンコーダーとして、事前学習済みのAlbert-xxlargeモデルを微調整する。
  • 文脈と質問・選択肢ペアの間のクロスアテンションを計算するために、二重マルチヘッド相互注意(DUMA)モジュールを用いる。これにより、より深い相互作用が可能になる。
  • 文脈、質問、選択肢を<sep>トークンを用いて1つのシーケンスに連結し、エンコーダーおよびDUMA層に入力する。
  • 2つのDUMAアテンション表現(文脈→QAおよびQA→文脈)に対して平均プーリングを適用し、分類用に連結する。
  • 交差エントロピー損失を用い、選択肢の上での線形分類器で最適化することで、回答予測を目的とする。
  • DREAMとRACEのデータセットサイズに比例してミニバッチをサンプリングすることで、すべてのモデルコンponentを共有するマルチタスク学習を実装する。

実験結果

リサーチクエスチョン

  • RQ12つの多選択MRCデータセット(DREAMとRACE)を共同で学習することで、より小さいDREAMデータセットの性能が向上するか?
  • RQ2共通のモデルアーキテクチャを用いたマルチタスク学習が、会話形式と本文形式の文脈の間で有用な推論パターンを転送できるか?
  • RQ3二重マルチヘッド相互注意機構(DUMA)の統合が、多選択読解における性能にどのように影響するか?
  • RQ4マルチタスク学習が、低リソースなMRCデータセット(DREAM)において過学習を緩和し、一般化性能を向上させる程度はどの程度か?
  • RQ5RACEとDREAMの間のドメインや形式の違いによる負の干渉を考慮しても、マルチタスク学習による性能向上が依然として優位であるか?

主な発見

  • 提案されたマルチタスク学習モデルは、DREAMデータセットにおいて91.8%という新たなSOTAテスト精度を達成し、Zhuら(2020)の90.4%という以前の最高結果を上回った。
  • DREAMデータセットは小さく、会話形式の文脈を用いている一方でRACEは本文形式の文脈を用いているにもかかわらず、共同学習による利益が顕著に得られた。
  • Albert-xxlarge + DUMAの単一タスク実装は、開発セットで90.7%、テストセットで88.6%を達成し、強力なベースライン性能を示した。
  • マルチタスク学習の設定は、単一タスクベースラインおよび以前のSOTAよりも、開発セットおよびテストセットの両方で性能を向上させた。
  • 結果から、類縁だが同一ではないMRCタスク間で、マルチタスク学習が推論パターンを効果的に転送でき、文脈形式の違いがあっても有効であることが示唆された。
  • モデルの性能向上は、共有表現学習を通じて、より大きな関連データセットを活用することで低リソースMRCタスクの性能を向上させることの価値を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。