Skip to main content
QUICK REVIEW

[論文レビュー] Sparse*BERT: Sparse Models Generalize To New tasks and Domains

Daniel Campos, Alexandre Carriconde Marques|arXiv (Cornell University)|May 25, 2022
Topic Modeling被引用数 4
ひとこと要約

この論文では、一般ドメインの事前学習中に段階的で構造のないマグニチュードプルーニングを適用して訓練されたスパース*BERTを紹介する。このモデルは、タスク固有のハイパーパrameterチューニングを必要とせず、生物学的分野のような新しいドメインにも効果的に一般化する。得られたSparseBioBERTは、パラメータの10%しか使用しないにもかかわらず、BioBERTと同等のパフォーマンスを達成し、多様な生物医学的NLPタスクおよびデータスパarsity状況において強力なゼロショット転送性と頑健性を示している。

ABSTRACT

Large Language Models have become the core architecture upon which most modern natural language processing (NLP) systems build. These models can consistently deliver impressive accuracy and robustness across tasks and domains, but their high computational overhead can make inference difficult and expensive. To make using these models less costly, recent work has explored leveraging structured and unstructured pruning, quantization, and distillation to improve inference speed and decrease size. This paper studies how models pruned using Gradual Unstructured Magnitude Pruning can transfer between domains and tasks. Our experimentation shows that models that are pruned during pretraining using general domain masked language models can transfer to novel domains and tasks without extensive hyperparameter exploration or specialized approaches. We demonstrate that our general sparse model Sparse*BERT can become SparseBioBERT simply by pretraining the compressed architecture on unstructured biomedical text. Moreover, we show that SparseBioBERT can match the quality of BioBERT with only 10\% of the parameters.

研究の動機と目的

  • プルーニングされた大規模言語モデルが、広範なハイパーパrameterチューニングを伴わずに新しいドメインやタスクに効果的に一般化できるかどうかを調査すること。
  • プルーニングの段階(事前学習 vs. ファインチューニング)が、生物医学的NLPにおける転移性能に与える影響を評価すること。
  • 最小限のドメイン固有の事前学習で特定のドメインに適応可能な、スパースで汎用的なモデルを開発すること。
  • スパースモデルがパラメータ数を大幅に削減しながらも、密度モデルと同等またはそれを上回るパフォーマンスを達成できることを示すこと。

提案手法

  • プルーニングは、小文字のBERTを用いた一般ドメインの事前学習中に段階的で構造のないマグニチュードプルーニングを適用して実施される。
  • プルーニングされたアーキテクチャは、ドメイン固有の生物医学的テキストでファインチューニングされ、SparseBioBERTとして特殊化されたスパースモデルが作成される。
  • パフォーマンスの保持を図るために、温度2.0、ハードネス0.8で知識蒸留がファインチューニング中に使用される。
  • 複数の生物医学的データセットを用いて、エンティティ抽出、関係抽出、質問応答タスクの評価が行われる。
  • 学習データサイズを体系的に変化させ(1%から100%まで)、データ効率性とデータ不足に対する頑健性を評価する。
  • 事前学習中にプルーニングされたモデル(Sparse*BERT)、ファインチューニング中にプルーニングされたモデル、および密度型BERTのパフォーマンスを比較する実験が実施される。

実験結果

リサーチクエスチョン

  • RQ1一般ドメインのデータで学習されたプルーニング済みの大規模言語モデルは、追加のハイパーパrameterチューニングなしで、新しいドメインに効果的に転送可能か?
  • RQ2特にリソースが限られた生物医学的NLPタスクにおいて、事前学習段階でのプルーニングがファインチューニング段階でのプルーニングよりも優れた転移パフォーマンスを示すか?
  • RQ3データスパarsity下でのモデルスパarsityがパフォーマンスに与える影響は何か?また、データ効率性という観点から、密度モデルと比較してどうなるか?
  • RQ41つのスパースアーキテクチャが、最小限のドメイン固有の事前学習を経て、新しいドメイン(例:生物学)に適応可能で、密度型のドメイン固有モデルと同等のパフォーマンスを達成できるか?

主な発見

  • 一般ドメインの事前学習中にプルーニングされたSparse*BERTは、生物医学的NLPタスクにおいて、活性パラメータが10%しかないにもかかわらず、BioBERTと同等のパフォーマンスを達成する。
  • エンティティ抽出タスクでは、事前学習中にプルーニングしたモデルがファインチューニング中にプルーニングしたモデルよりも4ポイント近く優れており、全体でも2ポイント上回っている。これは、BERTとBioBERTの差をも上回る。
  • Sparse*BERTは、学習データサイズが変化しても高いパフォーマンスを維持する。100%のデータではF1スコアが88.50、1%のデータでは60.91に低下するが、わずかに低下するにとどまる。一方、ファインチューニング済みのプルーニングモデルは急激に性能が低下する。
  • NCBI や GAD のような小規模データセットでは、ファインチューニング中にプルーニングしたモデルが顕著な精度低下を示すが、Sparse*BERTは頑健性を維持する。
  • 事前学習段階でのプルーニングが、ファインチューニング段階でのプルーニングよりも一般化性能が優れている。特にデータが少ない状況下で顕著で、初期段階でのプルーニングが転送可能性を保存していることが示唆される。
  • SparseBioBERTは、パラメータ数に対して最先端のパフォーマンスを達成しており、90%の活性パラメータを削減したにもかかわらず、BioBERTの正確さを再現し、タスク固有の最適化なしに同等の性能を発揮している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。