Skip to main content
QUICK REVIEW

[論文レビュー] BayesFormer: Transformer with Uncertainty Estimation

Karthik Abinav Sankararaman, Sinong Wang|arXiv (Cornell University)|Jun 2, 2022
Model Reduction and Neural Networks被引用数 8
ひとこと要約

BayesFormerは、注意機構とフィードフォワード層に独自のドロップアウト機構を適用する近似変分推論を用いて、理論的裏付けのある不確実性推定手法をTransformerに導入する。ドロップアウトを注意およびフィードフォワード層に適用することで、予測不確実性のキャリブレーションが向上し、過学習が軽減され、NLPタスク全般(アクティブラーニングや長文脈モデリングを含む)における性能が向上する。

ABSTRACT

Transformer has become ubiquitous due to its dominant performance in various NLP and image processing tasks. However, it lacks understanding of how to generate mathematically grounded uncertainty estimates for transformer architectures. Models equipped with such uncertainty estimates can typically improve predictive performance, make networks robust, avoid over-fitting and used as acquisition function in active learning. In this paper, we introduce BayesFormer, a Transformer model with dropouts designed by Bayesian theory. We proposed a new theoretical framework to extend the approximate variational inference-based dropout to Transformer-based architectures. Through extensive experiments, we validate the proposed architecture in four paradigms and show improvements across the board: language modeling and classification, long-sequence understanding, machine translation and acquisition function for active learning.

研究の動機と目的

  • 小データやハイリスクな状況において、数学的に裏付けられた不確実性評価が不足している点を是正すること。
  • モデルのロバスト性を向上させ、過学習を低減し、実世界の展開における予測信頼性の推定を高めること。
  • より正確な不確実性推定を提供することで、サンプル選択に役立てるアクティブラーニングのパフォーマンスを向上させること。
  • Transformerアーキテクチャに特化した、理論的裏付けのあるドロップアウトベースの不確実性推定フレームワークを開発すること。
  • 微調整、長文脈理解、機械翻訳を含む多様なNLPパラダイムへの一般化を実証すること。

提案手法

  • 重みにガウス事前分布を仮定し、近似変分推論を用いてTransformer重みの事後分布を導出する。
  • 注意層とフィードフォワードサブレイヤーの両方にドロップアウトを適用する新しいドロップアウト構造を導入し、ドロップアウト率はそれぞれ0.05とする。
  • 11回の順伝播によるモンテカルロドロップアウト(MCDropout)を用いて予測不確実性とエピステミック不確実性を推定し、BALDの獲得関数を適用する。
  • エビデンス下界(ELBO)の目的関数を用いてBayesFormerを訓練し、近似事後分布と真の事後分布のKLダイバージェンスを最小化する。
  • 従来のドロップアウト率を変更せずに、標準的なTransformerアーキテクチャを維持しつつ、注意層およびフィードフォワード層にのみベイジアンドロップアウトを追加する。
  • 一般化と不確実性キャリブレーションの向上を図るため、ラベルスムージングとLabelSmoothedCrossEntropyCriterionを用いて訓練する。

実験結果

リサーチクエスチョン

  • RQ1近似変分推論をTransformerアーキテクチャに効果的に拡張することで、数学的に裏付けられた不確実性推定が可能になるか?
  • RQ2提案されたBayesFormerのドロップアウト機構は、標準的なTransformerにおける標準MCDropoutと比較して、不確実性キャリブレーションをどのように改善するか?
  • RQ3BayesFormerの不確実性推定は、低ラベル予算下でもアクティブラーニングにおいて優れたパフォーマンスをもたらすか?
  • RQ4標準RoBERTaと比較して、小規模データセットでの微調整時にBayesFormerは過学習をどの程度軽減するか?
  • RQ5BayesFormerの不確実性推定は、系列モデリング、翻訳、ゼロショット転移を含む多様なNLPタスクに一般化可能か?

主な発見

  • CoLA開発セットではBayesFormerが32.1のMCCを達成し、RoBERTa base(21.3)を顕著に上回り、一般化性能と不確実性キャリブレーションの向上を示した。
  • GLUEベンチマークでは、SST-2で91.3%の精度、MRPCで90.9%のF1スコア、MNLIで83.3%の精度を達成し、複数のタスクでRoBERTa baseを上回った。
  • アクティブラーニングでは、10%のデータのみを用いても、開発セットのMCCが62.8に達し、RoBERTaより4ポイント、ランダムサンプリングより3.6ポイント高い結果を示した。
  • 一部のラベル付きデータを破棄することで最良のモデルパフォーマンスが達成されたことから、BayesFormerの不確実性推定がノイズや曖昧な例への過学習を回避するのに役立つことが示された。
  • 機械翻訳タスクでは、ベースラインTransformerと比較してテストBLEUスコアが0.5〜1.0 BLEUポイント向上し、バリデーションBLEUも上昇したため、より良い一般化性能を示した。
  • 長文脈理解やフェイシュート学習を含むすべての評価タスクで、新たなドロップアウト率以外の追加ハイパーパramータチューニングなしに、性能向上を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。