Skip to main content
QUICK REVIEW

[論文レビュー] On the comparability of Pre-trained Language Models

Matthias Aßenmacher, Christian Heumann|arXiv (Cornell University)|Jan 3, 2020
Topic Modeling参考文献 41被引用数 11
ひとこと要約

この論文は、2018–2019年の最先端の事前学習言語モデルについて、アーキテクチャの革新、トレーニングリソース、トランスファーラーニング統合の観点から包括的な比較分析を提供している。研究の再現可能性と公平なベンチマーク評価を向上させるために、モデル開発および評価指標に関する透明性を高めるための実行可能で実務的なガイドラインを提唱している。

ABSTRACT

Recent developments in unsupervised representation learning have successfully established the concept of transfer learning in NLP. Mainly three forces are driving the improvements in this area of research: More elaborated architectures are making better use of contextual information. Instead of simply plugging in static pre-trained representations, these are learned based on surrounding context in end-to-end trainable models with more intelligently designed language modelling objectives. Along with this, larger corpora are used as resources for pre-training large language models in a self-supervised fashion which are afterwards fine-tuned on supervised tasks. Advances in parallel computing as well as in cloud computing, made it possible to train these models with growing capacities in the same or even in shorter time than previously established models. These three developments agglomerate in new state-of-the-art (SOTA) results being revealed in a higher and higher frequency. It is not always obvious where these improvements originate from, as it is not possible to completely disentangle the contributions of the three driving forces. We set ourselves to providing a clear and concise overview on several large pre-trained language models, which achieved SOTA results in the last two years, with respect to their use of new architectures and resources. We want to clarify for the reader where the differences between the models are and we furthermore attempt to gain some insight into the single contributions of lexical/computational improvements as well as of architectural changes. We explicitly do not intend to quantify these contributions, but rather see our work as an overview in order to identify potential starting points for benchmark comparisons. Furthermore, we tentatively want to point at potential possibilities for improvement in the field of open-sourcing and reproducible research.

研究の動機と目的

  • アーキテクチャ、トレーニングデータ、トランスファーラーニング統合の観点から、主な事前学習言語モデル(例:BERT、GPT、RoBERTa)の主な差異を明確化すること。
  • 性能向上に寄与する要因(アーキテクチャの変更、モデルサイズ、計算リソース)の相対的貢献度を定量的に測定せずに、それらの影響を特定すること。
  • 特に計算コスト、ハイパーパramータチューニング、リソース使用量に関して、NLP研究における一貫性のない報告基準の欠如に対処すること。
  • 標準化された報告フレームワークを提唱することで、再現可能性とオープンサイエンスを促進し、NLPコミュニティ全体におけるモデル報告の標準化を図ること。
  • 広範なハイパーパramータチューニングおよび大規模モデルトレーニングの環境的・実用的影響を強調し、開発リソースの報告における透明性を促すこと。

提案手法

  • アーキテクチャ的・トレーニング的特徴を体系的に比較するため、12種類の事前学習言語モデル(例:Word2Vec、FastText、ULMFiT、ELMo、GPT、BERT、GPT2、XLNet、RoBERTa、ALBERT)を対象とした構造化された表を用いる。
  • コンテキスト性(一方向的 vs. 双方向的)、トレーニングパラダイム(埋め込みのみ vs. エンドツーエンド学習可能)、アーキテクチャ(LSTM、Transformerなど)に基づいてモデルを分類する。
  • 各報告次元(例:モデルアーキテクチャ、パラメータ数、ハイパーパramータ、トレーニング時間)について、実行可能性、現在の実現状況、再現可能性への関連性を評価する報告フレームワークを提唱する。
  • 環境的および実用的配慮を支援するために、語彙リソース(例:トレーニングコーパスのサイズ、入手可能性)および計算コスト(GPU時間、エネルギー使用量)の報告の重要性を強調する。
  • 正確なFLOP数の計算に代わる実用的でアクセスしやすい代替手段として、OpenAIブログのGPU時間推定法を、モデル間のトレーニング負荷を比較する目的で用いる。
  • 「チューニングなし」モデルの定義を明確かつ一貫して行い、公平なベンチマーク比較を可能にするとともに、ハイパーパramータチューニングの影響を低減することを提唱する。

実験結果

リサーチクエスチョン

  • RQ12018–2019年の主要な事前学習言語モデル間で、主なアーキテクチャ的およびリソース的差異は何か?
  • RQ2トランスフォーマー、双方向アテンションなどのアーキテクチャ的革新が、モデルスケールや事前学習コーパスサイズに比べて性能向上にどれほど寄与しているか?
  • RQ3モデルサイズ、計算リソース、ハイパーパramータチューニングの重複要因が性能向上に寄与している場合、なぜモデル間の公平な比較が困難になるのか?
  • RQ4標準化された報告慣行は、NLP研究における再現可能性と透明性をどのように向上させることができるか?
  • RQ5広範なハイパーパramータチューニングおよび大規模モデルトレーニングが、事前学習言語モデルに与える環境的・実用的影響は何か?

主な発見

  • NLP論文において、トレーニング時間、ハイパーパramータチューニング、計算リソースなどのモデル開発詳細の報告基準は一貫していない。
  • モデルアーキテクチャやパラメータ数は広く報告されているが、チューニング手法、チューニング時間、実験実行時間の詳細は頻繁に欠落しており、再現可能性に悪影響を与えている。
  • 語彙リソース(例:事前学習コーパス)の可用性および記述が、モデル性能と再現可能性において極めて重要な役割を果たすにもかかわらず、しばしば欠落している。
  • 「チューニングなし」モデルのパフォーマンスおよび計算コストについて、世界的に受け入れられる報告フレームワークの強力な必要性が同定された。これは、公平なベンチマーク比較を可能にする。
  • トレーニング時間および計算リソースの報告は実行可能で、再現性にとって極めて関連性が高いが、現在のところ公表された研究ではほとんど存在しない。
  • 実行可能性と影響のバランスを取った実用的で段階的な報告基準を提唱し、特に「モデルアーキテクチャ」、「パラメータ数」、「チューニング済みモデルのベンチマークパフォーマンス」は、重要かつ報告可能であるとされた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。