Skip to main content
QUICK REVIEW

[論文レビュー] Grid Search Hyperparameter Benchmarking of BERT, ALBERT, and LongFormer on DuoRC

Alex John Quijano, Sam Nguyen|arXiv (Cornell University)|Jan 15, 2021
Topic Modeling参考文献 19被引用数 6
ひとこと要約

本研究では、SQuADおよびDuoRCで事前学習されたモデルを微調整する際、BERT、ALBERT、LongFormerの3モデルについて、DuoRC質問応答データセット上で包括的なグリッドサーチによるハイパーパramータのベンチマークを実施した。SQuADで事前学習したモデルを微調整したALBERTは、SelfRCで76.4のF1スコアと68.52の正解率を達成した。一方、SelfRCで事前学習したLongFormerは、ParaphraseRCで52.78のF1スコアと46.60の正解率を記録し、他のモデルを上回った。

ABSTRACT

The purpose of this project is to evaluate three language models named BERT, ALBERT, and LongFormer on the Question Answering dataset called DuoRC. The language model task has two inputs, a question, and a context. The context is a paragraph or an entire document while the output is the answer based on the context. The goal is to perform grid search hyperparameter fine-tuning using DuoRC. Pretrained weights of the models are taken from the Huggingface library. Different sets of hyperparameters are used to fine-tune the models using two versions of DuoRC which are the SelfRC and the ParaphraseRC. The results show that the ALBERT (pretrained using the SQuAD1 dataset) has an F1 score of 76.4 and an accuracy score of 68.52 after fine-tuning on the SelfRC dataset. The Longformer model (pretrained using the SQuAD and SelfRC datasets) has an F1 score of 52.58 and an accuracy score of 46.60 after fine-tuning on the ParaphraseRC dataset. The current results outperformed the results from the previous model by DuoRC.

研究の動機と目的

  • 系統的なハイパーパramータチューニングを通じて、BERT、ALBERT、LongFormerのDuoRC質問応答データセット上での性能を評価すること。
  • 複数の構成におけるグリッドサーチを用いて、各モデルの最適ハイパーパramータを特定すること。
  • SelfRC(短い、元のプロット)とParaphraseRC(長い、言い換えられたプロット)の2つのDuoRCサブセットにおけるモデル性能を比較すること。
  • 事前学習データ(例:SQuAD1、SQuAD2、SelfRC)が、読解タスクにおける微調整性能に与える影響を評価すること。
  • 複雑な推論要件を伴う物語的および言い換えられたドキュメント理解の文脈において、トランスフォーマーベースモデルのベンチマークを確立すること。

提案手法

  • BERT、ALBERT、LongFormerの事前学習済み重みは、Hugging Faceのモデルハブから取得した。
  • 最大シーケンス長(msl)、ドロップアウト率(ds)、最大クエリ長(mql)、トレーニングバッチサイズ(tbs)の複数のハイパーパramータに対してグリッドサーチを実施した。
  • モデルは2つのDuoRCサブセット(SelfRC:元の短いプロット、ParaphraseRC:より長い言い換えられたプロット)で微調整した。
  • 評価指標には、各ハイパーパramータ設定におけるバリデーションセットおよびテストセットのF1スコアと正解率を含めた。
  • 最良のハイパーパラメータ組み合わせはバリデーションセットの性能に基づき選択され、最終的な結果はテストセットで報告された。
  • 交差エントロピー損失とAdamW最適化を用いた標準的なHugging Face Transformersトレーニングパイプラインで微調整を実施した。

実験結果

リサーチクエスチョン

  • RQ1BERTベースのモデル(BERT、ALBERT、LongFormer)の中で、ハイパーパラメータチューニング後、DuoRCデータセットで最高のパフォーマンスを示すのはどれか?
  • RQ2事前学習データ(SQuAD1、SQuAD2、SelfRC)は、DuoRCにおける微調整性能にどのように影響するか?
  • RQ3SelfRCおよびParaphraseRCサブセットで最適なF1スコアと正解率を達成するハイパーパラメータ設定(msl、ds、mql、tbs)は何か?
  • RQ4F1スコアと正解率がSelfRCとParaphraseRCで異なる理由は何か?また、モデルアーキテクチャはこの差にどのように影響するか?
  • RQ5長文対応を目的として設計されたLongFormerは、絶対的なスコアが低くても、より長いParaphraseRCサブセットで他のモデルを上回る可能性があるか?

主な発見

  • SQuAD1で事前学習したALBERTモデルは、微調整後にSelfRCデータセットで76.4のF1スコアと68.52の正解率を達成した。
  • SelfRCで事前学習したLongFormerモデルは、ParaphraseRCで最高のパフォーマンスを示し、F1スコア52.78、正解率46.60を記録した。
  • 最大シーケンス長384トークン、バッチサイズ64で微調整した場合、全モデルで一貫して高いパフォーマンスが得られた。
  • DuoRC固有のデータ(例:selfduorc)で事前学習したモデルは、SQuADで事前学習したモデルに比べてわずかな改善を示し、特にParaphraseRC設定で顕著だった。
  • ParaphraseRCにおけるF1スコアは、常にSelfRCより低く、より長い文脈と低い語彙的類似度のため、より困難であることが示された。
  • ParaphraseRCにおけるLongFormerの最良パフォーマンスを示した設定は、シーケンス長768、ドロップアウト0.3、バッチサイズ4であり、バリデーションセットで52.78のF1スコアを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。