Skip to main content
QUICK REVIEW

[論文レビュー] An Empirical Study on Hyperparameter Optimization for Fine-Tuning Pre-trained Language Models

Xueqing Liu, Chi Wang|arXiv (Cornell University)|Jun 17, 2021
Topic Modeling参考文献 32被引用数 5
ひとこと要約

本研究では、GLUEタスク上でBERTおよびRoBERTaの微調整に対して、ハイパラメータ最適化(HPO)手法—ベイズ最適化、ランダムサーチ、および早期停止—を実験的に評価する。同じ時間予算を有するグリッドサーチと比較しても、HPOはしばしば性能を発揮しない。これは、予算が不十分で、検証セットへの過剰適合(overfitting)が生じるためである。しかし、拡大した予算と縮小された探索空間を用いた体系的なトラブルシューティング手順を適用することで、いくつかのケースでグリッドサーチを上回る性能が得られる。これは、NLPの微調整におけるHPOでは、慎重な設定と過剰適合の緩和が不可欠であることを示している。

ABSTRACT

The performance of fine-tuning pre-trained language models largely depends on the hyperparameter configuration. In this paper, we investigate the performance of modern hyperparameter optimization methods (HPO) on fine-tuning pre-trained language models. First, we study and report three HPO algorithms' performances on fine-tuning two state-of-the-art language models on the GLUE dataset. We find that using the same time budget, HPO often fails to outperform grid search due to two reasons: insufficient time budget and overfitting. We propose two general strategies and an experimental procedure to systematically troubleshoot HPO's failure cases. By applying the procedure, we observe that HPO can succeed with more appropriate settings in the search space and time budget; however, in certain cases overfitting remains. Finally, we make suggestions for future work. Our implementation can be found in https://github.com/microsoft/FLAML/tree/main/flaml/nlp/.

研究の動機と目的

  • 同じ時間予算のもとで、自動化されたHPO手法が従来のグリッドサーチを上回るかどうかを評価すること。
  • NLPの微調整におけるHPOの失敗の主な原因を特定すること、特に時間予算の不足と過剰適合(overfitting)を対象とする。
  • 言語モデルの微調整におけるハイパラメータ最適化の失敗をトラブルシュートする体系的な実験手順を設計・検証すること。
  • 実践的かつ実行可能な推奨事項を提示し、特にリソースが限られたあるいは分散が大きいNLPタスクにおけるHPOの性能向上を図ること。

提案手法

  • 本研究では、2つの最先端モデル(ElectraとRoBERTa)を用いて、GLUEタスク全体で3つのHPO手法—ベイズ最適化、ランダムサーチ、早期停止—を評価する。
  • 各HPO手法に固定された時間予算Bを課し、グリッドサーチとの公平な比較を実現する。各試行では、D_val 上でのモデルの訓練と検証が含まれる。
  • 探索空間Sは、初期学習率、バッチサイズ、重み減衰の3つの主要ハイパーパラメータに定義され、それぞれの設定が適切にサンプリングまたは最適化される。
  • 体系的なトラブルシューティング手順を提案する。この手順では、探索空間の段階的精錬と時間予算の増加を繰り返し行い、過剰適合の低減とHPO性能の向上を図る。
  • 評価プロトコルf(·)は、検証精度(STS-Bではピアソン相関係数)を用い、最終的なモデル性能はD_testで評価して一般化性能を測定する。
  • 実験は固定された乱数シード(42)を用いて実施され、確率的要因によるばらつきを排除することで再現性を確保し、公平な比較を実現する。

実験結果

リサーチクエスチョン

  • RQ1同じ時間予算のもとで、自動化されたHPO手法は、事前学習済み言語モデルの微調整においてグリッドサーチを上回ることができるか?
  • RQ2どのNLPタスクにおいてHPO手法がグリッドサーチを上回る性能を示すか?
  • RQ3事前学習済み言語モデルの微調整という文脈において、HPOの失敗の主な原因は何か?
  • RQ4過剰適合と不足した時間予算を体系的に緩和することで、HPO性能をどのように向上させられるか?
  • RQ5探索空間の設定がHPOの成功に与える影響は何か?また、モデルやタスクに応じてどのように最適化できるか?

主な発見

  • グリッドサーチと同等の時間予算のもとで、HPO手法はしばしばグリッドサーチを上回れない。これは、探索が不十分で、検証セットへの過剰適合(overfitting)が生じるためである。
  • 特にRTE、MRPC、CoLAといったタスクでは、学習率とバッチサイズのみを探索しても、過剰適合は根強く残る問題である。
  • 時間予算を拡大し、モデルおよびタスク固有のパターンに基づいて探索空間を狭めることで、複数のGLUEタスクでHPOがグリッドサーチを上回る性能を発揮する。
  • ランダムサーチは、限られた予算のもとで、より高度なベイズ最適化や早期停止手法と比較しても、一貫して高い性能を示し、しばしばそれを上回る。
  • 本研究では、デフォルトのグリッドサーチ設定自体がすでに高度にチューニングされていることが判明しており、これはHPOが慎重な設定なしではそれらを上回るのが難しいことを説明している。
  • 提案された体系的なトラブルシューティング手順により、HPOの信頼性が著しく向上し、探索空間設計が成功に不可欠であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。