[論文レビュー] The Diminishing Returns of Masked Language Models to Science
本研究は、14種類の科学固有のBERTモデル(770MパラメータのSCHOLARBERTを含む)を用い、12の科学的情報抽出タスクにおいて、モデルサイズ、学習データ量、事前学習/微調整時間の影響を評価した。その結果、これらのリソースの増加による利得は次第に小さくなることが判明した——1% F1を超える向上はまれであり、タスク依存的である。これは、科学的NLP分野におけるスケーリングの利点に関する仮定に疑問を呈するものである。
Transformer-based masked language models such as BERT, trained on general corpora, have shown impressive performance on downstream tasks. It has also been demonstrated that the downstream task performance of such models can be improved by pretraining larger models for longer on more data. In this work, we empirically evaluate the extent to which these results extend to tasks in science. We use 14 domain-specific transformer-based models (including ScholarBERT, a new 770M-parameter science-focused masked language model pretrained on up to 225B tokens) to evaluate the impact of training data, model size, pretraining and finetuning time on 12 downstream scientific tasks. Interestingly, we find that increasing model sizes, training data, or compute time does not always lead to significant improvements (i.e., >1% F1), if at all, in scientific information extraction tasks and offered possible explanations for the surprising performance differences.
研究の動機と目的
- モデルサイズ、学習データ、計算時間の拡大が、科学的情報抽出タスクのパフォーマンスに与える影響を調査すること。
- 大規模で多様な科学的コーパスに特化した事前学習が、一般または小規模分野のモデルよりも一貫した向上をもたらすかどうかを評価すること。
- 下流の科学的NLPタスクにおいて、多様な科学的テキスト(225Bトークン)を用いた事前学習と、小規模または専門的なコーパスを用いた事前学習の有効性を評価すること。
- 一般ドメイン言語モデル(例:GPT)で観察されたスケーリング法則が、科学的マスク言語モデルにも適用可能かどうかを検証すること。
提案手法
- Public.Resource.Orgが提供する225Bトークンの多様な分野にまたがる科学的コーパスを用い、14種類のBERTベースのモデル(例:BERT-Base、SciBERT、PubMedBERT)を事前学習した。
- SCHOLARBERTモデルは、RoBERTaの事前学習手順に従い、データサブセット(1%、10%、100%)を変更し、WikipediaのBooks(WikiBooks)を含める/含めないを組み合わせて作成した。
- 8つの名前付きエンティティ認識(NER)タスクと、生物学、化学、材料科学分野の4つの文分類タスクを含む12の下流タスクでモデルを訓練・評価した。
- 5回のランダム実行におけるF1スコアの平均値を測定し、標準偏差を報告することで、ばらつきの程度を評価した。
- アーキテクチャ、事前学習手法、コーパス、キャピタルタイピングの4つの次元を比較することで、スケールとドメイン固有性の影響を分離した。
- すべてのタスクで標準化された微調整プロトコルを用い、モデルパフォーマンスの公平な比較を確保した。
実験結果
リサーチクエスチョン
- RQ1モデルサイズ、学習データ、または事前学習時間の増加が、下流の科学的情報抽出タスクにおいて一貫した改善をもたらすか。
- RQ2大規模で多様な科学的コーパス(225Bトークン)に特化したドメイン固有の事前学習が、一般または小規模分野の事前学習を上回る程度はどの程度か。
- RQ3一般ドメイン言語モデル(例:GPT)で観察されたスケーリング法則が、科学的マスク言語モデルにも適用可能か。
- RQ4スケーリングによるパフォーマンス向上は、異なる科学的分野やタスクタイプにおいてどのように比較されるか。
主な発見
- モデルサイズや学習データの増加が一貫した向上をもたらさなかった——12のタスクのうちわずか15%のタスクで、より大きなモデルやより多くのデータによる1% F1を超える向上が観察された。
- SCHOLARBERT-XL(770Mパラメータ)は12のタスクのうち5つで最高のF1スコアを記録したが、ほとんどのタスクで小さなモデルと比較してわずかな向上(≤1% F1)にとどまった。
- NCBI-DiseaseおよびSciERC NERタスクでは、一般コーパス(例:BERT-Base)で事前学習したモデルが、ドメイン固有のモデル(例:SciBERT、PubMedBERT)と同等または優れた性能を示した。
- ColeridgeおよびChemProt文分類タスクでは、小規模または非科学的コーパス(例:SB_1)で事前学習したモデルが、より大きな科学的固有のモデルと同等または優れた性能を示した。
- 事前学習にWikiBooksを追加した(例:SB_10_WB、SB_100_WB)モデルでは、いくつかのタスクでパフォーマンスが低下した。これは、ドメインの不一致や過学習のリスクを示唆している。
- 図2および図3のエラーバーに示されるように、モデル間の標準偏差に顕著な重複が見られた。これは、パフォーマンスの差が、とくに大きなモデルではしばしば統計的に強くないことを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。