Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Fine-Tuning of BERT Models on the Edge

Danilo Vucetic, Mohammadreza Tayaranian|arXiv (Cornell University)|May 3, 2022
Distributed and Parallel Computing Systems被引用数 4
ひとこと要約

本稿では、活性化および勾配のメモリ使用量を削減するために、パラメータを選択的に凍結し、モデルアーキテクチャを再構成することで、エッジデバイス上でBERTに類似したモデルのメモリ効率の良い微調整を実現する、Freeze And Reconfigure (FAR) を提案する。FARは、DistilBERTで10%の保持率と1%のプリミングを用いた場合、微調整時間を30%短縮し、メモリアクセス時間を47%削減するが、GLUEおよびSQuADベンチマークで平均1%の性能低下にとどまる。

ABSTRACT

Resource-constrained devices are increasingly the deployment targets of machine learning applications. Static models, however, do not always suffice for dynamic environments. On-device training of models allows for quick adaptability to new scenarios. With the increasing size of deep neural networks, as noted with the likes of BERT and other natural language processing models, comes increased resource requirements, namely memory, computation, energy, and time. Furthermore, training is far more resource intensive than inference. Resource-constrained on-device learning is thus doubly difficult, especially with large BERT-like models. By reducing the memory usage of fine-tuning, pre-trained BERT models can become efficient enough to fine-tune on resource-constrained devices. We propose Freeze And Reconfigure (FAR), a memory-efficient training regime for BERT-like models that reduces the memory usage of activation maps during fine-tuning by avoiding unnecessary parameter updates. FAR reduces fine-tuning time on the DistilBERT model and CoLA dataset by 30%, and time spent on memory operations by 47%. More broadly, reductions in metric performance on the GLUE and SQuAD datasets are around 1% on average.

研究の動機と目的

  • リソース制限のあるエッジデバイス上で大規模なBERTに類似したモデルのオンデバイス微調整の課題に対処すること。
  • 活性化および勾配の保存に起因して、推論よりも顕著に高いメモリおよび計算負荷を伴う微調整中のメモリおよび計算オーバーヘッドを低減すること。
  • クラウドベースの再トレーニングに依存せずに、動的環境における事前学習済み言語モデルの実用的オンデバイス適応を可能にすること。
  • エッジハードウェア上でトレーニングリソースの消費を著しく削減しながらも、高いモデル性能を維持すること。
  • 構造的な効率的パラメータ凍結戦略を開発し、プルーニングベース手法で一般的な無構造的メモリアクセスパターンを回避すること。

提案手法

  • 選択的微調整に適した高学習可能性を持つパラメータグループを特定するための新規L1ノルムベースの指標を導入する。
  • 凍結済みおよび非凍結パラメータをグループ化することで、メモリアクセスの局所性を向上させる動的アーキテクチャ再構成を提案する。
  • 2段階のプロセスを実装する:学習可能性ノードの初期化(プライミング)の段階と、保持率に基づく選択的重み更新の段階。
  • トレーニングオーバーヘッドを最小限に抑えるために1%のプライミングを用い、保持率(例:10%、40%)を調整することで、効率性と精度のトレードオフを制御する。
  • 非重要レイヤーやノードに対して選択的にパラメータ凍結を適用し、完全なレイヤー凍結を避けることで、モデル容量を維持する。
  • モデルのパラメータレイアウトを再構造することで、キャッシュミスとメインメモリ帯域幅の使用量を削減し、メモリアクセスパターンを最適化する。

実験結果

リサーチクエスチョン

  • RQ1選択的パラメータ凍結とアーキテクチャ再構成を組み合わせることで、エッジデバイス上でのBERT微調整におけるメモリ使用量を顕著に削減できるか?
  • RQ2モデル性能に顕著な低下を来さずに、微調整時間およびメモリアクセスオーバーヘッドをどの程度まで削減できるか?
  • RQ3プライミングおよび保持率の選択が、圧縮されたBERTモデルの微調整における効率性と精度のトレードオフにどのように影響するか?
  • RQ4既存のベースライン(例:BitFit やランダムノード選択)に比べ、本手法が効率性および性能の両面で優れているか?
  • RQ5本手法は、DistilBERTなどの他の圧縮モデルに一般化可能であり、GLUE や SQuAD などの多様な自然言語処理タスクに適用可能か?

主な発見

  • 10%の保持率と1%のプライミングを用いた場合、CoLAデータセットでDistilBERTを微調整する際、FARは微調整時間を30%短縮し、メモリアクセス時間を47%削減する。
  • 40%の保持率を用いる場合、FARはベースラインと比較して微調整時間を17%短縮し、メモリアクセス時間を36%削減する。
  • GLUEおよびSQuADベンチマーク全体での平均性能低下はわずか1%であり、40%保持率のFARでは最小の低下(0.74%)が観察された。
  • FARはランダムノード選択およびBitFitを上回り、特にSQuAD 2.0のような複雑なタスクでは、BitFitがF1スコアで10%以上の低下を示すが、FARはその影響を軽減する。
  • 過酷なパラメータ凍結に対しても高い性能を維持するため、過パラメータ化により選択的かつ効率的な微調整が可能であることを示している。
  • アブレーションスタディにより、プライミングおよび構造的再構成が不可欠であることが確認され、同じリソース制約下でもランダム選択やBitFitは著しく悪い結果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。