Skip to main content
QUICK REVIEW

[論文レビュー] BERTQA -- Attention on Steroids

Ankit Chadha, Rewa Sood|arXiv (Cornell University)|Dec 14, 2019
Topic Modeling参考文献 6被引用数 5
ひとこと要約

BERTQAは、SQuAD 2.0における回答スパン検出を向上させるために、BERTに指向的な共注意メカニズム(コンテキストからクエリへのC2QおよびクエリからコンテキストへのQ2C)を導入する。局所的特徴抽出のための1次元畳み込みと残差接続を統合することで、ベースアーキテクチャでは77.03のF1、アンサンブルでは82.317のF1/79.442のEMを達成し、バックトランスレーションで作成されたデータセット(SQUAD 2.Q)を用いることで、未回答検出および一般化性能が顕著に向上する。

ABSTRACT

In this work, we extend the Bidirectional Encoder Representations from Transformers (BERT) with an emphasis on directed coattention to obtain an improved F1 performance on the SQUAD2.0 dataset. The Transformer architecture on which BERT is based places hierarchical global attention on the concatenation of the context and query. Our additions to the BERT architecture augment this attention with a more focused context to query (C2Q) and query to context (Q2C) attention via a set of modified Transformer encoder units. In addition, we explore adding convolution-based feature extraction within the coattention architecture to add localized information to self-attention. We found that coattention significantly improves the no answer F1 by 4 points in the base and 1 point in the large architecture. After adding skip connections the no answer F1 improved further without causing an additional loss in has answer F1. The addition of localized feature extraction added to attention produced an overall dev F1 of 77.03 in the base architecture. We applied our findings to the large BERT model which contains twice as many layers and further used our own augmented version of the SQUAD 2.0 dataset created by back translation, which we have named SQUAD 2.Q. Finally, we performed hyperparameter tuning and ensembled our best models for a final F1/EM of 82.317/79.442 (Attention on Steroids, PCE Test Leaderboard).

研究の動機と目的

  • 指向的な共注意メカニズム(C2QおよびQ2C)を導入することで、BERTのSQuAD 2.0における未回答質問の検出性能を向上させる。
  • BERTのグローバルアテンションの限界を補うために、クエリとコンテキスト間の階層的でコンテキストに依存するアテンションフローに焦点を当てる。
  • 1次元畳み込みを統合することで、グローバル自己アテンションに加えて局所的テクストパターンを捉える特徴表現を強化する。
  • バックトランスレーションを用いたデータ拡張により、より多様な訓練データセット(SQUAD 2.Q)を構築することで、モデルの一般化性能を向上させる。
  • 最適化とアンサンブルを実施し、特に未回答F1においてSQuAD 2.0開発セットで最先端の性能を達成する。

提案手法

  • クエリとコンテキスト表現を指向的かつ階層的に処理する専用のC2QおよびQ2C共注意モジュールをBERTの自己アテンション機構に統合する。
  • 共注意層の後に残差(スキップ)接続を導入し、訓練の安定性と勾配の流れを改善する。
  • 共注意アーキテクチャ内に1次元畳み込み層を挿入し、局所的なn-gram特徴を抽出することで、短距離依存関係の表現を強化する。
  • 開始位置と終了位置のスパン予測ヘッドを別々に使用し、開始および終了位置のための別々のログイットを用いて、SQuAD 2.0で微調整する。
  • NMTを介してSQuAD 2.0の例を英語にバックトランスレーションすることで、言語的多様性と耐性を高めた拡張データセットSQUAD 2.Qを生成する。
  • ハイパーパramータチューニングと上位3つのモデルのアンサンブルを実施し、特に未回答質問に対して一般化性能と耐性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1指向的な共注意(C2QおよびQ2C)は、SQuAD 2.0における未回答質問の検出能力をBERTが向上させるか?
  • RQ2共注意機構に1次元畳み込み層を統合することで、局所的テクストパターンを捉えることで性能が向上するか?
  • RQ3バックトランスレーションによるデータ拡張(SQUAD 2.Q)は、モデルの一般化性能および耐性をどの程度向上させるか?
  • RQ4スキップ接続とアンサンブル学習は、特に未回答質問においてF1スコアとEMスコアにどのような影響を及けるか?
  • RQ5定性的な例から、共注意メカニズムは標準のBERTアテンションよりも単語ペアの関連性をより良く保持できるか?

主な発見

  • C2QおよびQ2C共注意の追加により、ベースBERTモデルでは未回答F1が4ポイント向上、大規模モデルでは1ポイント向上した。
  • スキップ接続の導入により、has-answer F1に悪影響を及げず、未回答F1がさらに向上した。これは、より良い一般化性能と訓練の安定性を示している。
  • ベースモデルは、共注意と畳み込み特徴抽出を統合した後、開発セットでF1が77.03を達成した。
  • 最終的なアンサンブルモデルは、SQuAD 2.0テストセットでF1が82.317、EMが79.442を達成し、BERT Largeより3.5ポイントの向上を示した。
  • 定性的分析の結果、モデルは語のペア(例:「spirit」と「Christian」)を別個の概念として保持することで、未回答質問を正しく特定した。一方、BERT Largeはこれらを誤って結合していた。
  • 誤差分析の結果、モデルは「What」質問における誤りを30件も削減したが、バックトランスレーションに起因するアーティファクトの影響で「Which」と「What」のカテゴリが混同された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。