[論文レビュー] Bridging the Gap between Language Model and Reading Comprehension: Unsupervised MRC via Self-Supervision
本稿では、自己教師ありフレームワークを提案し、事前学習言語モデル(PLM)と機械読解(MRC)の間のギャップを埋めるために、ラベルなしデータを用いて答えのスパンを特定・コピーする能力を学習する新しい事前学習タスク「Spotting-MLM」を導入する。推論時に質問を再構成することでモデルの頑健性を向上させ、標準的なMRCベンチマークで最先端の性能を達成し、敵対的データセットではデータ合成ベースラインを最大34.7 F1ポイント上回る。
Despite recent success in machine reading comprehension (MRC), learning high-quality MRC models still requires large-scale labeled training data, even using strong pre-trained language models (PLMs). The pre-training tasks for PLMs are not question-answering or MRC-based tasks, making existing PLMs unable to be directly used for unsupervised MRC. Specifically, MRC aims to spot an accurate answer span from the given document, but PLMs focus on token filling in sentences. In this paper, we propose a new framework for unsupervised MRC. Firstly, we propose to learn to spot answer spans in documents via self-supervised learning, by designing a self-supervision pretext task for MRC - Spotting-MLM. Solving this task requires capturing deep interactions between sentences in documents. Secondly, we apply a simple sentence rewriting strategy in the inference stage to alleviate the expression mismatch between questions and documents. Experiments show that our method achieves a new state-of-the-art performance for unsupervised MRC.
研究の動機と目的
- SQuADのような大規模な人手によるアノテーションデータセットに依存するMRCモデルのデータ集約的特性を是正すること。
- トークン埋め込みタスクで学習された事前学習言語モデル(PLM)と、文脈に依存するスパン抽出を要するMRCとのギャップを埋めること。
- 手動でラベル付けされたデータや合成データを一切用いずに、スパン抽出能力を学習する自己教師あり手法を開発すること。
- 推論時に質問と文書の表現不一致を是正することで、自己教師ありMRCにおける頑健性を向上させること。
- 自己教師あり学習がデータ合成と相補的であることを示し、限られたラベル付きデータでも性能向上を実現できることを示すこと。
提案手法
- 文書内に繰り返される情報的なスパンをマスクし、モデルが同じ文書内から正しいスパンをコピーするという、自己教師ありの事前学習タスク「Spotting-MLM」を導入する。
- モデルは単一のトークンを予測するのではなく、文の間の深い相互作用をモデル化し、意味的に関連するスパンを特定・抽出する必要がある。
- 推論時、質問を記述文に再構成することで、ラベルなしテキストの学習分布に一致させ、表現不一致を低減する。
- 標準的なトランスフォーマー基盤モデル(例:BERT)を、ラベルなしテキストコーパスのみを用いて自己教師ありのSpotting-MLMタスクで微調整するフレームワークを採用する。
- 自己教師ありモデルを合成MRCデータで微調整することで、データ合成技術と組み合わせ、性能をさらに向上させる。
- テンプレートベースやデータ駆動型の質問生成を避けて、生のテキストから直接スパン抽出を学ぶ自己教師あり学習に依存する。
実験結果
リサーチクエスチョン
- RQ1ラベルなしデータを一切用いずに、文脈に依存するスパン抽出能力を効果的に学習できる自己教師あり事前学習タスクは実現可能か?
- RQ2推論時に質問を記述文に再構成することで、表現不一致が低減され、自己教師ありMRCの頑健性が向上するか?
- RQ3標準的および敵対的MRCベンチマークにおいて、提案手法の性能と頑健性は、データ合成ベースラインと比べてどうか?
- RQ4自己教師ありモデルは、低リソース環境において合成データと効果的に組み合わせて、さらなる性能向上を実現できるか?
- RQ5自己教師あり事前学習は、大規模な人手によるアノテーションMRCデータセットへの依存度をどの程度低減できるか?
主な発見
- 提案された自己教師あり手法は、自己教師ありMRCにおいて新たな最先端性能を達成し、敵対的データセットではデータ合成ベースラインを最大34.7 F1ポイント上回った。
- SQuADおよびNewsQAデータセットでは、EM/F1スコアがそれぞれ78.8/86.8および71.0/78.8を達成し、既存の自己教師ありベースラインを顕著に上回った。
- 敵対的データセットでは、最良のベースラインと比較してF1スコアが26.0および34.7ポイント向上し、優れた頑健性を示した。
- 低リソース環境では、ラベル付き学習データの1%での微調整でも平均F1が71.0を達成し、同じデータで微調整したBERTを上回った。
- 自己教師ありモデルとデータ合成を組み合わせることでさらなる性能向上が得られ、両手法の相補性を示した。
- 推論時の文の再構成戦略は一般化性能を顕著に向上させ、質問と文書の表現不一致の影響を低減した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。