Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Domain Adaptation for Machine Reading Comprehension

Huazheng Wang, Zhe Gan|arXiv (Cornell University)|Aug 24, 2019
Topic Modeling参考文献 51被引用数 6
ひとこと要約

本稿では、ラベルなしターゲットドメインのパスナージュに対して疑似質問を生成し、敵対的訓練を用いてドメイン不変表現を学習する、教師なし機械読解(MRC)のためのアドバーシャルドメイン適応フレームワークAdaMRCを提案する。この手法はドメイン間でMRC性能を向上させ、BERT や ELMo などのモデルと互換性があり、SQuAD、NewsQA、MS MARCO で一貫した向上を示している。

ABSTRACT

In this paper, we focus on unsupervised domain adaptation for Machine Reading Comprehension (MRC), where the source domain has a large amount of labeled data, while only unlabeled passages are available in the target domain. To this end, we propose an Adversarial Domain Adaptation framework (AdaMRC), where ($i$) pseudo questions are first generated for unlabeled passages in the target domain, and then ($ii$) a domain classifier is incorporated into an MRC model to predict which domain a given passage-question pair comes from. The classifier and the passage-question encoder are jointly trained using adversarial learning to enforce domain-invariant representation learning. Comprehensive evaluations demonstrate that our approach ($i$) is generalizable to different MRC models and datasets, ($ii$) can be combined with pre-trained large-scale language models (such as ELMo and BERT), and ($iii$) can be extended to semi-supervised learning.

研究の動機と目的

  • ラベルなしのターゲットドメインのパスナージュのみが利用可能な状況で、高リソースのソースドメインから低リソースのターゲットドメインへMRCモデルを転送する課題に対処すること。
  • 直接的にターゲットドメインデータで微調整した場合に性能が低下するドメインシフト問題を克服すること。
  • ラベルなしのターゲットドメインデータを必要とせず、一般化可能なフレームワークを構築すること。
  • 事前学習言語モデル(例:BERT、ELMo)および半教師あり学習設定と互換性を持つこと。
  • 低リソースドメイン適応の状況において、MRCモデルのロバスト性と性能を向上させること。

提案手法

  • 質問生成モデルを用いて、ラベルなしのターゲットドメインパスナージュに対して合成された質問・回答ペアを生成する。
  • ソースドメインとターゲットドメインのサンプルを区別できるように、MRCモデルにドメイン識別器を統合する。
  • 敵対的学習により、パスナージュ・質問エンコーダーとドメイン識別器を同時に訓練し、ドメイン不変表現を強制する。
  • タスク固有のMRC信号を保持しつつ、ドメイン固有の特徴を最小化するため、敵対的訓練を実施する。
  • 人間がアノテートしたソースデータと生成されたターゲットデータを統合し、MRCモデルを共同で学習する。
  • 少量のラベル付きターゲットドメインデータを組み込むことで、半教師あり学習設定への拡張を実現する。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしのパスナージュのみが利用可能なターゲットドメインへ転送する際、敵対的ドメイン適応がMRC性能を向上させることができるか。
  • RQ2ラベルなしのターゲットデータのもとで、本手法がドメイン不変表現をどれほど効果的に学習できるか。
  • RQ3AdaMRC が異なるMRCアーキテクチャーやデータセットにどれほど一般化可能か。
  • RQ4BERT や ELMo などの事前学習言語モデルとAdaMRCを効果的に組み合わせることができるか。
  • RQ5少量のラベル付きターゲットドメインデータが利用可能な半教師あり設定でも、フレームワークが有効に機能するか。

主な発見

  • AdaMRC は、SQuAD、NewsQA、MS MARCO において、複数のMRCモデルでベースライン手法を上回る一貫した性能向上を達成した。
  • ラベルなしのターゲットドメインデータのみを用いても性能が向上することから、効果的な教師なしドメイン適応が実証された。
  • AdaMRC は事前学習モデルと強い相性を示した:BERT や ELMo と組み合わせた際、性能の向上が観察された。
  • 半教師あり設定では、ターゲットドメインのラベル付きデータが限られている場合(例:20%未満)に、AdaMRC はベースラインのSANを上回った。
  • ラベル付きターゲットデータが増加するに従い、AdaMRC と教師ありベースラインとの性能差が縮小する傾向を示し、低リソース環境下での有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。