[論文レビュー] Know What You Don't Need: Single-Shot Meta-Pruning for Attention Heads
本稿では、微調整の前に行い、テキスト表現の分布を維持するメタ学習基準を用いて、事前学習済みBERTモデルの注目ヘッドの50%までを1回のステップで剪定するSingle-Shot Meta-Pruning(SMP)を提案する。SMPは、微調整および推論のコストを低減しながら、微調整ベースラインと同等または優れた性能を達成し、剪定されたモデルは意味的関連性タスクにおいて一般化性能が向上している。
Deep pre-trained Transformer models have achieved state-of-the-art results over a variety of natural language processing (NLP) tasks. By learning rich language knowledge with millions of parameters, these models are usually overparameterized and significantly increase the computational overhead in applications. It is intuitive to address this issue by model compression. In this work, we propose a method, called Single-Shot Meta-Pruning, to compress deep pre-trained Transformers before fine-tuning. Specifically, we focus on pruning unnecessary attention heads adaptively for different downstream tasks. To measure the informativeness of attention heads, we train our Single-Shot Meta-Pruner (SMP) with a meta-learning paradigm aiming to maintain the distribution of text representations after pruning. Compared with existing compression methods for pre-trained models, our method can reduce the overhead of both fine-tuning and inference. Experimental results show that our pruner can selectively prune 50% of attention heads with little impact on the performance on downstream tasks and even provide better text representations. The source code will be released in the future.
研究の動機と目的
- 大規模な事前学習済みTransformerモデルにおける微調整および推論の計算負荷を低減すること。
- 微調整の前ではなく、事前学習済みモデルにおける不要な注目ヘッドを特定・削除すること。
- 多様な下流タスクにわたるモデル性能を維持する汎用的でワンショットの剪定手法を開発すること。
- メタ学習を用いて、異なるモデルサイズやタスクにわたって転送可能な暗黙の剪定ルールを学習すること。
提案手法
- テキスト表現の分布を剪定後に維持する自己教師付き目的を用いて、SMP(メタラーナー)を訓練し、注目ヘッドの重要度を予測する。
- 多様なコーパスを用いたメタ学習フレームワークを採用し、剪定器の訓練中にさまざまな下流タスクをシミュレートする。
- 微調整の前に行い、反復的最適化を回避する1回のステップで注目ヘッドを削除するワンショット剪定戦略を適用する。
- 情報量を反映するスコア関数を用いてヘッドの重要度を測定し、高いスコアは有用なヘッドを示す。
- スコアが低いヘッド(情報量が低いとされる)を識別し、削除する。
- 下流タスクにおける性能と効率の向上を評価するために、剪定後のモデルを評価する。
実験結果
リサーチクエスチョン
- RQ1微調整の前に行い、計算コストを低減できるように、事前学習済みTransformerの注目ヘッドを効果的に剪定できるか?
- RQ2メタ学習された剪定器は、さまざまな下流タスクやモデルアーキテクチャに一般化できるか?
- RQ3ワンショット剪定は、反復的微調整に基づく圧縮と同等またはそれ以上の性能を達成できるか?
- RQ4一部の注目ヘッドを剪定することで、特定の自然言語処理タスクにおけるモデルの一般化性能が向上するか?
- RQ5剪定された注目ヘッドが示す暗黙のパターンは何か?また、それらは人間が解釈する注目メカニズムと整合性があるか?
主な発見
- SMPは、GLUEベンチマークタスクにおいて、BERTの50%の注目ヘッドを剪定しても、性能の低下を最小限に抑えられる。
- 50%のヘッドを剪定すると、メモリ使用量が30%削減され、より大きなバッチサイズで効率的な学習が可能になる。
- 一部のケースでは剪定が性能を向上させる。特にSentEvalにおける意味的関連性タスクでは、SMPはランダム剪定を上回り、HISP再学習と同等の性能を達成する。
- 少ないパラメータでさえも、微調整後の圧縮ベースラインと同等または優れた結果を達成する。
- SMPが学習した暗黙の剪定ルールは、視覚化された注目行列から人間の直感と整合性があることが示された。
- 剪定器は強く転送可能である:BERT_BASEで訓練されたモデルはBERT_LARGEに対しても良好に一般化し、QNLIのような新規タスクに対しても良好に動作する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。