[論文レビュー] Improving Vision Transformers for Incremental Learning
本稿では、3つの主要な課題である収束の遅さ、新規クラスへのバイアス、分類器層の不足適合に対処することで、Vision Transformersのクラス増分学習(CIL)を向上させるViTILという手法を提案する。畳み込みスタム、クラスバランスのとれた微調整、分類器用の大規模な学習率を組み合わせることで、CIFAR-100およびImageNet-1000の3つの増分学習設定において、既存手法をはっきりと上回る新たなSOTA性能を達成する。
This paper proposes a working recipe of using Vision Transformer (ViT) in class incremental learning. Although this recipe only combines existing techniques, developing the combination is not trivial. Firstly, naive application of ViT to replace convolutional neural networks (CNNs) in incremental learning results in serious performance degradation. Secondly, we nail down three issues of naively using ViT: (a) ViT has very slow convergence when the number of classes is small, (b) more bias towards new classes is observed in ViT than CNN-based architectures, and (c) the conventional learning rate of ViT is too low to learn a good classifier layer. Finally, our solution, named ViTIL (ViT for Incremental Learning) achieves new state-of-the-art on both CIFAR and ImageNet datasets for all three class incremental learning setups by a clear margin. We believe this advances the knowledge of transformer in the incremental learning community. Code will be publicly released.
研究の動機と目的
- Vision Transformers (ViT) をクラス増分学習(CIL)に直接適用した場合に、CNNと比較して性能が著しく低下する理由を調査すること。
- ViTのCILにおける性能を阻害する3つの主要な課題——少数クラスでの遅い収束、新規クラスへのバイアス増加、分類器層の不足適合——を同定および診断すること。
- アーキテクチャの革新を伴わずに、既存の技術を組み合わせて効果的かつ実用的な解決策を考案すること。
- CIFAR-100およびImageNet-1000の複数のCILプロトコルにおいて、ViTベースのCILの新たなSOTAベースラインを確立すること。
提案手法
- ViTの標準的なパッチ化スタムを畳み込みスタムに置き換えることで、初期最適化を改善し、特に少数クラスでの初期増分ステップにおける収束を加速する。
- クラスバランスのとれた微調整(CBF)を適用し、ViTに内在する新規クラスへのバイアスを是正する。これはMixUp や CutMix などのデータオーグメンテーション技術と併用可能である。
- 特徴抽出部とは対照的に、分類器ヘッドに顕著に大きな学習率を設定することで、ソフトマックス温度を上昇させ、分類器における不足適合を軽減する。
- 畳み込みスタム、CBF、大規模な分類器学習率の3要素を統合し、増分学習に最適化された一貫したトレーニングレシピ「ViTIL」として統合する。
- B50、B0、T20K設定を含む標準的なCIL評価プロトコルを採用し、アブレーションスタディにおいても一貫したハイパーパrameterを維持する。
実験結果
リサーチクエスチョン
- RQ1なぜVision Transformersをクラス増分学習に直接適用すると、CNNと比較して顕著な性能低下が生じるのか?
- RQ2特に少数クラスでの初期段階において、ViTベースのモデルが増分学習中に性能が低下する根本的要因は何か?
- RQ3既存の技術を効果的に組み合わせることで、収束速度、クラスバイアス、分類器の不足適合の問題をどのように解決できるか?
- RQ4洗練されたSOTA CILモデルを凌駕する複雑なアーキテクチャを用いずに、標準的な手法の単純な組み合わせがCIFAR-100およびImageNet-1000ベンチマークで優れた性能を達成できるか?
主な発見
- 500初期クラスと1ステップあたり100新規クラスのCIL設定下で、ImageNet-1000におけるトップ1精度は69.20%に達し、LUCIR+DDEを1.69%上回った。
- 10ステップCIL設定(1ステップあたり100新規クラス、旧クラスあたり20エグジンプリ)において、ViTILは平均増分精度65.13%を達成し、PODNetを7.27%上回った。
- 全エグジンプリ制約設定(T20K)では、ViTILは68.75%の精度を達成し、BiCを6.28%上回った。
- アブレーションスタディの結果、畳み込みスタム、CBF、大規模な分類器学習率の各要素が、すべてのCILプロトコルにおいて独立的かつ一貫して性能向上に寄与することが確認された。
- LUCIRと比較して、ViTILは平均増分忘れが著しく低く抑えられており、柔軟性を損なわずに安定性が向上していることが示された。
- 畳み込みスタムを備えなくても、バイアス補正と大規模な分類器学習率を組み合わせたViTILは、B50 C10 R20設定において平均増分精度でLUCIRを3.66%上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。