Skip to main content
QUICK REVIEW

[論文レビュー] BitFit: Simple Parameter-efficient Fine-tuning for Transformer-based Masked Language-models

Elad Ben Zaken, Shauli Ravfogel|arXiv (Cornell University)|Jun 18, 2021
Natural Language Processing Techniques被引用数 10
ひとこと要約

BitFit は、事前学習された BERT モデルのバイアス項のみを更新するパラメータ効率の良い微調整手法であり、GLUE タスクにおいて完全微調整と同等の性能を達成し、小規模〜中規模のデータ環境では完全微調整を上回る性能を示す。0.04% のモデルパラメータのみを変更することで、計算コストを最小限に抑えつつ、タスクに依存しないストリームベースの学習が可能になる。

ABSTRACT

We introduce BitFit, a sparse-finetuning method where only the bias-terms of the model (or a subset of them) are being modified. We show that with small-to-medium training data, applying BitFit on pre-trained BERT models is competitive with (and sometimes better than) fine-tuning the entire model. For larger data, the method is competitive with other sparse fine-tuning methods. Besides their practical utility, these findings are relevant for the question of understanding the commonly-used process of finetuning: they support the hypothesis that finetuning is mainly about exposing knowledge induced by language-modeling training, rather than learning new task-specific linguistic knowledge.

研究の動機と目的

  • 事前学習されたトランスフォーマーのバイアス項のみを更新することで、微調整を極めてパラメータ効率の良いものにできるかどうかを検討すること。
  • 特にデータが少ない環境において、バイアスのみの微調整が完全微調整の性能を同等または上回るかどうかを調査すること。
  • 最小限のメモリおよびパラメータのオーバーヘッドで、複数の NLP モデルをタスクに依存しない形でストリームベースでデプロイできるようにすること。
  • バイアス項が事前学習からダウンストリームタスクへの知識の転送に果たす役割を理解すること。
  • 完全なパラメータ更新が有効な微調整に不可欠であるという仮定に疑問を呈すること。

提案手法

  • トランスフォーマーのエンコーダー重みをすべて固定し、すべてのレイヤーおよびアテンションヘッドのバイアス項のみを微調整する。
  • 固定されたエンコーダーの上にタスク固有の分類ヘッドを維持し、バイアス項と同時にエンドツーエンドで学習する。
  • バックプロパゲーションを用いて、他のすべての重みを固定したまま、バイアスパラメータのみを更新する。
  • 同じバイアス更新戦略をすべてのタスクに適用することで、一貫性があり再利用可能なモデル重みを実現する。
  • 微調整を二つのバイアス成分(クエリとMLPの中間部)に限定することで、パラメータ更新率を 0.04% に抑える。
  • さまざまな訓練データサイズの下で、GLUE および SQuAD タスクのパフォーマンスを評価し、データ効率を測定する。

実験結果

リサーチクエスチョン

  • RQ1事前学習された BERT モデルのバイアス項のみを微調整することで、完全微調整と同等の性能を達成できるか?
  • RQ2バイアスのみの微調整は、データが少ない環境で完全微調整を上回る性能を示すか?
  • RQ3再トレーニングなしに、同じ更新済みバイアスパラメータを複数のダウンストリームタスクに再利用できるか?
  • RQ4微調整が主に事前学習段階で学習された知識を露呈するものであるのに対し、新しい言語的パターンを学習するものではない、という点でどの程度の影響を及ぼすか?
  • RQ5バイアス項は、微調整中にモデルの挙動の変化にどのように寄与しているか?

主な発見

  • BitFit はすべての GLUE タスクで完全微調整と同等の性能を達成し、BERT BASE では SQuAD で正確なスコア 97.2 を達成した。
  • 小規模〜中規模の訓練データ環境では、BitFit が完全微調整を上回る性能を示し、特に小さなサブセットを用いた SQuAD v1.0 で顕著であった。
  • クエリとMLPの中間部の二つのバイアス成分のみを微調整することで、パラメータ更新率が 0.04% に抑えられつつも、競争力のある正確性を維持した。
  • BitFit はタスク不変性を維持する:同じバイアスパラメータを再トレーニングなしに異なるタスクに再利用可能である。
  • モデルの大部分をハードウェアに埋め込むことで、微調整可能なバイアスパラメータが数個であるため、効率的なハードウェアデプロイが可能になった。
  • 結果は、微調整が主に事前学習段階で学習された知識を露呈するものであるという仮説を支持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。