[論文レビュー] RomeBERT: Robust Training of Multi-Exit BERT
RomeBERTは、勾配正則化付き自己蒸留を用いて、早期および後期の出口間の性能の不均衡を軽減する、マルチエグジットBERTのための頑健な訓練フレームワークを提案する。1段階のプロセスでBERTバックボーンと複数の分類器を同時に訓練することで、RomeBERTは優れた速度-性能トレードオフを達成し、DeeBERTおよびFastBERTを凌ぎ、GLUEベンチマークで最大65.2%の推論時間短縮を達成しながら、ベースモデルにほぼ同等の精度を維持する。
BERT has achieved superior performances on Natural Language Understanding (NLU) tasks. However, BERT possesses a large number of parameters and demands certain resources to deploy. For acceleration, Dynamic Early Exiting for BERT (DeeBERT) has been proposed recently, which incorporates multiple exits and adopts a dynamic early-exit mechanism to ensure efficient inference. While obtaining an efficiency-performance tradeoff, the performances of early exits in multi-exit BERT are significantly worse than late exits. In this paper, we leverage gradient regularized self-distillation for RObust training of Multi-Exit BERT (RomeBERT), which can effectively solve the performance imbalance problem between early and late exits. Moreover, the proposed RomeBERT adopts a one-stage joint training strategy for multi-exits and the BERT backbone while DeeBERT needs two stages that require more training time. Extensive experiments on GLUE datasets are performed to demonstrate the superiority of our approach. Our code is available at https://github.com/romebert/RomeBERT.
研究の動機と目的
- マルチエグジットBERTにおける、早期エグジットが後期エグジットに比べて顕著に性能が劣るという問題に対処すること。
- BERTバックボーンを固定する必要をなくし、1段階的でエンドツーエンドの訓練を可能にすることで、2段階訓練の必要性を排除すること。
- 強固な訓練技術を用いて最終エグジットの精度を損なわず、早期エグジットの性能を向上させること。
- DeeBERT や FastBERT などの既存手法よりも優れた効率-性能トレードオフを達成すること。
- BERTバックボーンの固定を避け、モデルの表現力が保たれる1段階的で統合的な訓練を可能にすること。
提案手法
- GEM や勾配手術にインspiredされた勾配正則化(GR)を導入し、早期および後期エグジット間の勾配をバランスさせ、トレーニングの衝突を低減する。
- 自己蒸留(SD)を用いて、最終エグジットから早期エグジットへソフトラベルの知識を転送し、一貫性を促進し、早期エグジットの性能を向上させる。
- BERTバックボーンとすべてのマルチエグジット分類器を1段階の統合訓練で行い、DeeBERTの2段階微調整を回避する。
- 最終エグジットには交差エントロピー損失を、早期エグジットには蒸留損失を適用し、GRを用いて勾配更新を安定化させる。
- 最終分類器からすべての中間分類器へソフトラベルの蒸留を適用し、エグジット層間での予測を一致させる。
- バックプロパゲーション中に矛盾する勾配を制約する、マルチエグジット設定において特に重要となる、新規の勾配正則化技術を採用する。
実験結果
リサーチクエスチョン
- RQ1自己蒸留は、最終エグジットの精度を損なわず、マルチエグジットBERTの早期エグジット性能を向上させることができるか?
- RQ2BERTバックボーンとマルチエグジット分類器の1段階的統合訓練は、固定されたBERTを用いた2段階微調整を上回る性能を達成できるか?
- RQ3勾配正則化は、マルチエグジットBERTにおける勾配の衝突を効果的に低減し、トレーニングの安定性を向上させることができるか?
- RQ4DeeBERT や FastBERT と比較して、RomeBERT は多様なNLPタスクにおいて推論効率と精度のトレードオフで優れているか?
- RQ5RomeBERTでは、従来の手法と比較して、どの程度エグジット層の分布が早期の層にシフトしているか?
主な発見
- RTEデータセットでは、RomeBERTは69.5%の精度を達成し、BERT-baseより0.1%高いが、期待される実行時間を10.6%短縮し、精度と効率の両面でDeeBERTおよびDeeBERT+SDを上回る。
- QNLIでは、RomeBERTは88.7%の精度を達成し、期待される実行時間の34.1%で実現した。一方、DeeBERTは15.2%高い時間コストと87.1%の精度を示した。
- QQPでは、RomeBERTは65.2%の時間短縮を達成し、F1スコア70.8%を達成した。一方、DeeBERTは同じ性能を達成するためには20.1%の追加時間が必要だった。
- 34.1%の実行時間に制限された場合、RomeBERTは88.7%の精度を維持したが、DeeBERTは82.4%、DeeBERT+SDは81.7%に低下した。
- RomeBERTのエグジット層の分布は、SST-2では60%のケースで第1層に集中しており、DeeBERT や DeeBERT+SD よりも顕著に早期エグジットにシフトしている。
- アブレーションスタディの結果、勾配正則化は全層の性能向上に寄与し、特にRTEおよびQNLIでは、QQPやMNLIの早期層で最大20%の性能向上が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。