Skip to main content
QUICK REVIEW

[論文レビュー] BERT's output layer recognizes all hidden layers? Some Intriguing Phenomena and a simple way to boost BERT

Wei-Tsung Kao, Tsung-Han Wu|arXiv (Cornell University)|Jan 25, 2020
Topic Modeling参考文献 22被引用数 6
ひとこと要約

この論文は、BERTの出力層が、訓練されていない中間層の隠れ表現から入力トークンを再構築できることを発見した—これは、層間で驚くべき表現の類似性を示している。事前学習済みBERTモデルの層を単に複製する(再訓練なし)ことで、SQuAD 2.0 や SNLI といった下流NLPタスクでの性能が向上し、F1スコアで最大1.5ポイント、正解率で0.6%の向上が得られた。これは、ベースラインモデルと同一のハイパーパrameterを用いても達成された。

ABSTRACT

Although Bidirectional Encoder Representations from Transformers (BERT) have achieved tremendous success in many natural language processing (NLP) tasks, it remains a black box. A variety of previous works have tried to lift the veil of BERT and understand each layer's functionality. In this paper, we found that surprisingly the output layer of BERT can reconstruct the input sentence by directly taking each layer of BERT as input, even though the output layer has never seen the input other than the final hidden layer. This fact remains true across a wide variety of BERT-based models, even when some layers are duplicated. Based on this observation, we propose a quite simple method to boost the performance of BERT. By duplicating some layers in the BERT-based models to make it deeper (no extra training required in this step), they obtain better performance in the downstream tasks after fine-tuning.

研究の動機と目的

  • 事前学習済みのBERT出力層が、最終層の表現以外の隠れ状態から入力系列を再構築できるかどうかを調査すること。
  • 事前学習済みの出力ヘッドを用いて中間層の表現類似性を調査すること。
  • 層の複製による深さの増加によって、BERTベースのモデルを訓練なしに改善する簡単な手法を開発・評価すること。
  • この深さ拡張が、文書分類、自然言語推論、質問応答などの下流NLPタスクでの性能向上に寄与するかどうかを評価すること。
  • 層の複製がアンサンブル手法やモデル一般化性能に与える影響を検討すること。

提案手法

  • 事前学習済みBERT出力層(MLMヘッド)をデコーダとして用い、追加の訓練なしに各層の出力から入力トークン系列を再構築する。
  • 各層の出力が出力層に入力された際のトークンレベルの再構築精度を評価する。
  • 重みを共有しない形で、既存の層を複製(例:BERT-baseでは最初の3層を複製)することでモデルの深さを増す層複製を適用する。
  • ベースラインと同一のハイパーパrameterを用いて、より深いモデルを下流タスクでファインチューニングし、直接的な性能比較を可能にする。
  • 異なる複製層構成を持つ複数のモデルの出力確率を合算することでアンサンブルモデルを作成し、性能向上を図る。
  • SST-2、SNLI、SQuAD 2.0 データセットを用いて、BERT-base、ALBERT-base、ALBERT-large、ALBERT-xlarge、ALBERT-xxlarge で実験を実施する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みのBERT出力層は、訓練されていない中間層の隠れ表現から、元の入力系列を再構築できるか?
  • RQ2BERTの異なる隠れ層の隠れ表現が、同じ出力層でデコード可能なほど十分に類似した分布を持っているか?
  • RQ3事前学習済みBERTモデルの層を複製することで、再訓練やハイパーパrameterチューニングなしに下流タスクの性能が向上するか?
  • RQ4層複製による性能向上は、さまざまなBERTバージョンやNLPタスクで一貫して得られるか?
  • RQ5層複製テクニックは、SQuAD 2.0 といった難易度の高いベンチマークでアンサンブルモデルの性能向上に寄与するか?

主な発見

  • 出力層は、最終層の表現のみで訓練されたにもかかわらず、すべての層の隠れ状態から高精度なトークンレベルの再構築が可能である。
  • この再構築能力は、ALBERTを含む複数のBERTバージョンに共通しており、層間で強い表現類似性があることを示している。
  • 事前学習済みBERTモデルの層を複製することで、SQuAD 2.0 と SNLI で一貫した性能向上が得られ、F1スコアで最大1.5ポイント、SNLI では正解率で0.6%の向上が得られた。
  • ベースラインモデルと同一の設定を用いて、追加の訓練やハイパーパrameterチューニングなしに性能向上が達成された。
  • 複数の複製層バージョンを組み合わせたアンサンブルモデルは、SQuAD 2.0 でさらなる性能向上を達成し、最良のアンサンブルでは85.50 EM と 88.59 F1 を達成した。
  • SST-2 では向上が認められなかったが、これはタスクの単純さと高いベースライン性能のため、向上の余地が限られていたためと推察される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。