Skip to main content
QUICK REVIEW

[論文レビュー] Length-Adaptive Transformer: Train Once with Length Drop, Use Anytime with Search

Gyuwan Kim, Kyunghyun Cho|arXiv (Cornell University)|Oct 14, 2020
Topic Modeling参考文献 63被引用数 9
ひとこと要約

この論文では、多様な計算リソース制約下でも効率的かついつでも推論可能な、1つのモデルで実現する長さ適応型トランスフォーマーを提案する。長さドロップ(LengthDrop)—各層で確率的にシーケンス長を短縮する構造的ドロップアウト—を用いた訓練と、多目的の進化的探索を組み合わせることで、再訓練を必要とせず最適な長さ設定を導出できる。この手法により、PoWER-BERTをトークンレベルのタスクに拡張するドロップ&リカバリープロセスを実装し、SQuAD 1.1、MNLI-m、SST-2で、精度と効率のトレードオフを優れた水準に保ちつつ最大3倍の高速化を達成した。

ABSTRACT

Despite transformers' impressive accuracy, their computational cost is often prohibitive to use with limited computational resources. Most previous approaches to improve inference efficiency require a separate model for each possible computational budget. In this paper, we extend PoWER-BERT (Goyal et al., 2020) and propose Length-Adaptive Transformer that can be used for various inference scenarios after one-shot training. We train a transformer with LengthDrop, a structural variant of dropout, which stochastically determines a sequence length at each layer. We then conduct a multi-objective evolutionary search to find a length configuration that maximizes the accuracy and minimizes the efficiency metric under any given computational budget. Additionally, we significantly extend the applicability of PoWER-BERT beyond sequence-level classification into token-level classification with Drop-and-Restore process that drops word-vectors temporarily in intermediate layers and restores at the last layer if necessary. We empirically verify the utility of the proposed approach by demonstrating the superior accuracy-efficiency trade-off under various setups, including span-based question answering and text classification. Code is available at https://github.com/clovaai/length-adaptive-transformer.

研究の動機と目的

  • 大規模な事前学習トランスフォーマーの高い推論コスト、特に計算リソースが制限される環境での課題に対処すること。
  • 各計算リソース制約ごとに別々のモデルを学習する必要をなくし、1つのモデルで複数の展開シナリオをカバーできるようにすること。
  • PoWER-BERTの適用範囲をシーケンスレベルの分類から、スパンベースの質問応答などのトークンレベルのタスクに拡張すること。
  • 自動化された設定探索により、推論中に精度と効率のトレードオフを細かく制御できること。
  • 多様なNLPタスクにおいて、FLOPsとウォールクロック推論時間を著しく削減しながらも、モデル性能を維持すること。

提案手法

  • 各トランスフォーマー層で、ランダムな長さ比に従ってトークンを確率的にドロップする構造的ドロップアウトであるLengthDropを導入。これにより、推論時に異なるシーケンス長に強い耐性が得られる。
  • LengthDropを用いて1度だけトランスフォーマーモデルを学習し、再訓練なしにさまざまな有効なシーケンス長を持つ複数のサブモデルを抽出可能にする。
  • 任意の計算リソース制約下で、FLOPsと推論時間を最小化しつつ精度を最大化する長さ設定を特定するため、多目的の進化的探索を適用する。
  • 中間層の単語ベクトルの一時的な保留(PoWER-BERTと同様)と、最終層での復元を組み合わせたドロップ&リカバリープロセスを設計。これにより、トークンレベルのタスクとの互換性が実現される。
  • 進化的探索により、精度と効率のトレードオフを網羅するパラトリア前線を生成し、任意のターゲットリソース制約に適合した展開が可能になる。
  • HuggingFace Transformersベースのモデルと統合し、広範な互換性と容易な展開を実現する。

実験結果

リサーチクエスチョン

  • RQ11度の学習で、再訓練や微調整なしに、推論時の計算リソース制約に応じて適応可能な1つのトランスフォーマーモデルを構築できるか?
  • RQ2統一されたモデルを用いて、多様な計算制約下で精度と効率のトレードオフを最適化できるか?
  • RQ3PoWER-BERTの効率化メカニズムを、スパンベースの質問応答などのトークンレベル分類タスクに拡張できるか?
  • RQ4標準的なトランスフォーマーと比較して、長さ適応型推論を用いることで、推論速度とFLOPsにどの程度の向上が得られるか?
  • RQ5最適な長さ設定を特定する際、進化的探索戦略はヒューリスティック法やしきい値ベースの手法と比べてどのように優れているか?

主な発見

  • 長さ適応型トランスフォーマーは、標準的なBERTと比較して、SQuAD 1.1、MNLI-m、SST-2で精度に損なわれることなく、ウォールクロック推論時間とFLOPsを最大3倍まで高速化した。
  • LengthDropのおかげで、テストした全長さ設定において強い性能を維持しており、シーケンス長の変動に対しても耐性があることが示された。
  • 進化的探索は、精度と効率のパラトリア前線に位置する最適な長さ設定を的確に特定できており、ヒューリスティック法や固定しきい値法を上回る性能を示した。
  • ドロップ&リカバリープロセスにより、スパンベースの質問応答のようなトークンレベルタスクに対しても、PoWER-BERTの効率化メカニズムを適用可能にした。これは、従来は不可能とされていた。
  • Slimmable Networks や DynaBERT と比較して、複数のNLPベンチマークで優れた精度-効率トレードオフを達成した。
  • このアプローチはモジュール型であり、HuggingFace Transformersと互換性があるため、既存のNLPパイプラインへの容易な統合が可能であり、将来的にはマルチモーダルモデルへの拡張も可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。