Skip to main content
QUICK REVIEW

[論文レビュー] Position Masking for Language Models

Andy Wagner, Tiyasa Mitra|arXiv (Cornell University)|Jun 2, 2020
Topic Modeling参考文献 5被引用数 4
ひとこと要約

本論文は、BERT風モデルにおけるマスクド言語モデル(MLM)の新規拡張として、マスクされたトークンの位置を追加でマスクし、専用の分類ヘッドを用いて予測する「位置マスキング」を提案する。この手法は、訓練収束の改善と性能向上を実現し、SQuADではF1スコアが0.3%向上し、IPUハードウェア上では元のBERT訓練のトークン数の50%にまで収束時間を短縮した。また、ドロップアウト層を通じた勾配フローの向上により、より迅速な収束が可能となった。

ABSTRACT

Masked language modeling (MLM) pre-training models such as BERT corrupt the input by replacing some tokens with [MASK] and then train a model to reconstruct the original tokens. This is an effective technique which has led to good results on all NLP benchmarks. We propose to expand upon this idea by masking the positions of some tokens along with the masked input token ids. We follow the same standard approach as BERT masking a percentage of the tokens positions and then predicting their original values using an additional fully connected classifier stage. This approach has shown good performance gains (.3\% improvement) for the SQUAD additional improvement in convergence times. For the Graphcore IPU the convergence of BERT Base with position masking requires only 50\% of the tokens from the original BERT paper.

研究の動機と目的

  • マスクド言語モデルに位置予測を追加することで、BERT風モデルの訓練効率と性能を向上させること。
  • 位置マスキングを追加することで、トランスフォーマー基盤の言語モデルにおける収束速度の向上と一般化性能の向上が見られるかを調査すること。
  • 位置マスキングがMLM事前学習および下流のSQuAD微調整タスクに与える影響を評価すること。
  • ドロップアウト層を通じた勾配フローの変更がモデル性能に与える影響を調査すること。
  • 同じ訓練レジーム下で、GPUとIPUハードウェアプラットフォーム間の訓練効率および精度を比較すること。

提案手法

  • 標準のトークン再構成ヘッドに加えて、マスクされたトークンの元の位置を予測する新たな全結合分類ヘッドを追加する。
  • モデルはBERTと同一のマスキング戦略を採用:90%のトークンがマスクされ、5%は正しい位置、5%はランダムな位置が使用される。
  • 位置マスキングはトークンマスキングに加えて適用され、位置符号化の学習に追加の監視信号を提供する。
  • アーキテクチャは、シーケンス長128および384、パイプライン化されたIPU実装を用いて、標準のBERT事前学習目的で訓練される。
  • ドロップアウトの勾配を強化する技術を導入し、バックプロpagation中にドロップアウトマスクを適用しないことで、微調整性能を向上させる。
  • 実験はGPUおよびIPUプラットフォームで実施され、ベースラインとしてBERT Baseが使用され、主な評価指標としてSQuADが用いられる。

実験結果

リサーチクエスチョン

  • RQ1トークン値に加えてトークンの位置をマスキングすることで、BERT風モデルの収束速度と最終的なモデル性能が向上するか?
  • RQ2位置マスキングは、トランスフォーマー・モデルにおける位置埋め込みの学習をどの程度向上させるか?
  • RQ3強化されたドロップアウト勾配技術は、標準のドロップアウトと比較して微調整性能にどのような影響を与えるか?
  • RQ4位置マスキングにより、特にIPUのような専用ハードウェア上での収束に必要な訓練トークン数を削減できるか?
  • RQ5F1スコアおよび収束時間の観点から、IPUとGPUプラットフォームにおける位置マスキングの相対的性能向上はどの程度か?

主な発見

  • IPU上では、標準のBERT訓練と比較して、SQuAD v1.1のF1スコアが0.3%向上し、EMが0.4%向上した。
  • IPU上では、元のBERT論文のトークン数の50%にまで収束時間が短縮され、位置マスキングがより迅速な収束を実現した。
  • GPUの結果では、SQuADでF1スコアが0.3%向上し、IPUの結果と一貫していたが、シーケンス長の制限によりピーク性能に到達しなかった。
  • 10%の位置マスキング率が最良のパフォーマンスを示し、15%マスキングではマスキングなしと同等の結果が得られ、5%マスキングでも10%と同程度の向上が見られた。
  • 強化されたドロップアウト勾配技術は、標準ドロップアウトと比較してSQuAD性能を0.5%向上させ、正則化効果の可能性を示唆した。
  • IPUは収束速度および定常状態性能の両面でGPUを上回り、位置マスキングを用いることで10%の収束速度向上が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。