[論文レビュー] Memory Efficient Continual Learning with Transformers
本稿では、アダプタモジュールと知識蒸留を用いて、深刻な忘却を防ぐメモリ効率の良い継続的学習手法である適応的蒸留アダプタ(ADA)を提案する。ADAは、固定されたパラメータ数を維持しながら、順次的なタスクにおいて高い精度を維持し、推論速度において最先端の手法を上回り、AdapterFusionと比較して最大10倍少ないパラメータを用いながら、テキストおよびビジョンタスクの両方で同等または優れた性能を達成する。
In many real-world scenarios, data to train machine learning models becomes available over time. Unfortunately, these models struggle to continually learn new concepts without forgetting what has been learnt in the past. This phenomenon is known as catastrophic forgetting and it is difficult to prevent due to practical constraints. For instance, the amount of data that can be stored or the computational resources that can be used might be limited. Moreover, applications increasingly rely on large pre-trained neural networks, such as pre-trained Transformers, since the resources or data might not be available in sufficiently large quantities to practitioners to train the model from scratch. In this paper, we devise a method to incrementally train a model on a sequence of tasks using pre-trained Transformers and extending them with Adapters. Different than the existing approaches, our method is able to scale to a large number of tasks without significant overhead and allows sharing information across tasks. On both image and text classification tasks, we empirically demonstrate that our method maintains a good predictive performance without retraining the model or increasing the number of model parameters over time. The resulting model is also significantly faster at inference time compared to Adapter-based state-of-the-art methods.
研究の動機と目的
- モデルが時間の経過とともに新しいタスクを学習する継続的学習の設定において、過去の知識を忘れないように、深刻な忘却を回避すること。
- 限られたメモリと計算リソースを有する実世界の応用において、事前学習済みトランスフォーマーを用いた効率的かつスケーラブルな継続的学習を可能にすること。
- モデルサイズの増加や再学習の必要なしに、増加するタスク数に対して高い予測性能を維持すること。
- 既存のアダプタベースの継続的学習手法と比較して、推論時間とメモリ使用量を削減すること。
- 多様な事前学習モデルを用いて、テキストおよびビジョン分類タスクの両方で、本手法の有効性を示すこと。
提案手法
- アダプタと知識蒸留を組み合わせて、過去のタスクからの知識を保持する手法として、適応的蒸留アダプタ(ADA)を導入する。
- パラメータ数がタスク数に依存しない固定サイズのアダプタプールを用い、新しいタスクに対して動的に選択・微調整することで、パラメータの増加を回避する。
- 過去のタスク固有のアダプタから現在のアダプタへの知識転送を促進するため、蒸留損失を用いることで、忘却を最小限に抑える。
- 特徴量レベルと出力確率レベルの両方の蒸留戦略を採用し、知識転送を向上させる。具体的には、LEEPおよびTransRateの2つの戦略を適用する。
- バイナリ分類およびマルチクラス分類の両方の状況をカバーし、テキスト(Arxiv, Reuters)およびビジョン(CIFAR100, MiniImageNet)ベンチマークで評価する。
- アダプタベースの微調整を、ビジョントランスフォーマー(DeiT, ViT)にも拡張し、モデルアーキテクチャを越えて汎用性を示す。
実験結果
リサーチクエスチョン
- RQ1アダプタと蒸留に基づく継続的学習手法は、パラメータ数を増加させずに、多数の順次タスクにおいて高い性能を維持できるか?
- RQ2ADA手法は、パラメータ数、推論速度、精度の観点から、最先端のアダプタベース手法と比較して、どのように優れているか?
- RQ3ADAにおける知識蒸留は、テキストおよびビジョンの継続的学習タスクにおいて、深刻な忘却をどの程度軽減できるか?
- RQ4ADAは、特に少サンプル設定において、既存手法と同等またはそれ以上の前向きおよび後向きの転送効果を達成できるか?
- RQ5ADAはビジョントランスフォーマーに効果的に適用可能であり、さまざまな事前学習済みビジョンモデルにおいても性能を維持できるか?
主な発見
- Arxivでは100件のラベル、Reutersでは160件のラベルという少サンプル設定でも、独立したアダプタと同等、あるいはそれを上回る性能を達成する。
- Arxivで200件のラベルを使用した場合、ADA-K=4とTransRateを組み合わせることで、独立したアダプタと同等の性能を達成するが、はるかに少ないパラメータ数を用いる。
- AdapterFusionと比較して、パラメータ数を10倍に削減し、タスク数にかかわらずパラメータ数が一定に保たれる。
- 固定サイズのアダプタプールと効率的な蒸留により、アダプタベースの最先端手法よりも推論速度が著しく高速である。
- DeiT-Bを用いたビジョンタスクでは、後向き転送誤差と前向き転送誤差の両方が低く抑えられ、BWTはほぼゼロに近く、前向き転送は正の値を示しており、知識の効果的な保持と転送が確認された。
- モデルの一般化性が確認された:DistilBERT、RoBERTa、ViT/DeiTの各モデルでも類似した性能トレンドが観察され、アーキテクチャを越えた堅牢性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。