Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Domain Adaptation of Contextualized Embeddings for Sequence Labeling

Xiaochuang Han, Jacob Eisenstein|arXiv (Cornell University)|Apr 4, 2019
Topic Modeling参考文献 47被引用数 8
ひとこと要約

この論文では、事前学習された文脈的埋め込み(例:BERT)を、ターゲットドメインのラベルなしデータが利用できない状況でも、ドメインに適応する微調整手法を提案する。マスク言語モデル化を用いて、ラベルなしのターゲットドメインテキスト上でBERTを微調整することで、特に未知語(out-of-vocabulary語)において顕著な改善が得られ、歴史的英語やTwitterの序列付けタスクで、強力なBERTベースラインを上回り、深刻な忘却(catastrophic forgetting)を回避する。

ABSTRACT

Contextualized word embeddings such as ELMo and BERT provide a foundation for strong performance across a wide range of natural language processing tasks by pretraining on large corpora of unlabeled text. However, the applicability of this approach is unknown when the target domain varies substantially from the pretraining corpus. We are specifically interested in the scenario in which labeled data is available in only a canonical source domain such as newstext, and the target domain is distinct from both the labeled and pretraining texts. To address this scenario, we propose domain-adaptive fine-tuning, in which the contextualized embeddings are adapted by masked language modeling on text from the target domain. We test this approach on sequence labeling in two challenging domains: Early Modern English and Twitter. Both domains differ substantially from existing pretraining corpora, and domain-adaptive fine-tuning yields substantial improvements over strong BERT baselines, with particularly impressive results on out-of-vocabulary words. We conclude that domain-adaptive fine-tuning offers a simple and effective approach for the unsupervised adaptation of sequence labeling to difficult new domains.

研究の動機と目的

  • 事前学習分布とは大きく異なるドメイン(例:歴史的英語やSNSテキスト)に、事前学習された文脈的埋め込みを適用する課題に対処すること。
  • ラベル付きデータがソースドメイン(例:ニューステキスト)でのみ入手可能である状況で、教師なしドメイン適応が序列付け性能を向上させられるかを調査すること。
  • ラベルなしターゲットドメインテキスト上でドメイン適応的微調整を施すことで、ソースドメインの性能が劣化することなく、未知語の性能向上が達成できるかを評価すること。
  • 教師あり微調整(深刻な忘却のリスクを伴う)と比較して、教師なしドメイン適応的微調整の有効性を検証すること。

提案手法

  • ドメイン適応的微調整を提案:マスク言語モデル化の目的関数を用いて、ラベルなしターゲットドメインテキスト上でBERTを微調整する。
  • 標準的な事前学習コーパスとは著しく異なる2つの挑戦的ドメイン(初期近代英語とTwitter)にこの手法を適用する。
  • ソースドメインのラベル付きデータで微調整済みの同じBERTモデルを出発点とし、その後でラベルなしターゲットドメインテキスト上でさらに適応する。
  • レア語や未知語を効果的に処理するため、WordPieceトークン化を採用し、低リソースドメインにおける耐性を高める。
  • ターゲットドメインのラベル付きデータを一切使用しないことで、ソースドメインでの性能を維持し、深刻な忘却を回避する。
  • 品詞タグ付けと固有表現認識の性能を評価し、強力なBERTベースラインおよび先行する教師なしドメイン適応手法と比較する。

実験結果

リサーチクエスチョン

  • RQ1ターゲットドメインにラベル付きデータが存在しない状況でも、教師なしドメイン適応的微調整が、初期近代英語やTwitterのようなドメイン外テキストの序列付け性能を向上させられるか?
  • RQ2ドメイン適応的微調整は、教師あり微調整と比較して、ソースドメインでの性能劣化がどれほど顕著か?
  • RQ3ドメイン適応的微調整は、低リソースドメインにおける未知語の性能向上を著しく達成できるか?
  • RQ4時間的変化(歴史的)やスタイルの変化(SNS)といった異なるタイプのドメインシフトに対して、ドメイン適応的微調整の性能向上は一貫しているか?
  • RQ51つのBERTモデルが、深刻な忘却を伴わずに、複数のドメインに対して教師なし微調整によって効果的に適応可能か?

主な発見

  • ドメイン適応的微調整は、初期近代英語における未知語の誤り率を50%以上削減し、強力なBERTベースラインを著しく上回る性能を達成した。
  • Twitterにおける固有表現認識の性能も向上し、2016年のWNUT共同タスクの大多数のシステムを上回った。
  • 教師あり微調整とは異なり、深刻な忘却を引き起こし、ソースドメインでの性能が低下するのではなく、ソースドメインおよびターゲットドメインの両方で強力な性能を維持した。
  • 明示的な適応ステップを一切行わずに、YangとEisenstein(2016)が提唱した最先端の教師なしドメイン適応手法を上回るBERTベースのタガーが実現可能であった。
  • 時間的変化(歴史的英語)やスタイルの変化(SNS)といった多様なドメインシフトに対しても効果的であり、広範な適用可能性を示した。
  • 結果から、教師なしドメイン適応的微調整により、1つのモデルが複数のドメインに一般化可能であり、NLP分野における継続的学習への有望な道筋を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。