Skip to main content
QUICK REVIEW

[論文レビュー] Overcoming Recency Bias of Normalization Statistics in Continual Learning: Balance and Adaptation

Yilin Lyu, Liyuan Wang|arXiv (Cornell University)|Oct 13, 2023
Domain Adaptation and Few-Shot LearningComputer Science被引用数 3
ひとこと要約

本稿では、継続的学習におけるバッチ正則化(BN)の最近性バイアスを克服するための新規手法AdaB2Nを提案する。AdaB2Nは、履歴的および現在のタスク統計を動的にバランスさせる。ベイジアンベースのタスク貢献重み付け戦略と、修正されたモーメンタム更新を組み合わせ、オンラインおよびオフラインの継続的学習ベンチマークでSOTA性能を達成。Split CIFAR-10では最大7.68%の精度向上を実現。

ABSTRACT

Continual learning entails learning a sequence of tasks and balancing their knowledge appropriately. With limited access to old training samples, much of the current work in deep neural networks has focused on overcoming catastrophic forgetting of old tasks in gradient-based optimization. However, the normalization layers provide an exception, as they are updated interdependently by the gradient and statistics of currently observed training samples, which require specialized strategies to mitigate recency bias. In this work, we focus on the most popular Batch Normalization (BN) and provide an in-depth theoretical analysis of its sub-optimality in continual learning. Our analysis demonstrates the dilemma between balance and adaptation of BN statistics for incremental tasks, which potentially affects training stability and generalization. Targeting on these particular challenges, we propose Adaptive Balance of BN (AdaB$^2$N), which incorporates appropriately a Bayesian-based strategy to adapt task-wise contributions and a modified momentum to balance BN statistics, corresponding to the training and testing stages. By implementing BN in a continual learning fashion, our approach achieves significant performance gains across a wide range of benchmarks, particularly for the challenging yet realistic online scenarios (e.g., up to 7.68%, 6.86% and 4.26% on Split CIFAR-10, Split CIFAR-100 and Split Mini-ImageNet, respectively). Our code is available at https://github.com/lvyilin/AdaB2N.

研究の動機と目的

  • 勾配および統計更新の影響で最近のタスクが優位になる継続的学習におけるバッチ正則化(BN)統計の最近性バイアスを解消すること。
  • BNにおける、履歴的タスク統計のバランスと現在のタスク分布への適応の間にある本質的トレードオフを特定すること。
  • 過去データの再利用に依存せず、BN統計の動的調整により、学習安定性と一般化性能を維持する手法を開発すること。
  • 特にクラスインクリメンタルおよびタスクインクリメンタルな状況において、オンライン(1パス)およびオフライン(複数エポック)の継続的学習設定で優れた性能を達成すること。
  • 過去データへのアクセスが限られる現実世界の継続的学習に適用可能な、理論的裏付けがありスケーラブルな解決策を提供すること。

提案手法

  • 活性化統計を条件とするタスクID上のカテゴリカル分布を用いて、タスクごとの貢献度を推定するベイジアンベースの戦略を導入する。
  • 推定されたタスク貢献度に基づき、安定性と適応性のバランスを取るための、修正された指数移動平均(EMA)モーメンタムを提案する。
  • 学習フェーズと推論フェーズを分離する:学習時、適応的モーメンタムを用いて学習を安定化させる。推論時、履歴を考慮したバランスの取れたBN統計推定値を維持する。
  • ハイパーパrameter λ を用いた正則化項を組み込み、新規タスク統計がBNに与える影響を制御し、滑らかな適応を確保する。
  • 計算効率を高めるために、タスク分布の近似にディリクレ事前分布を用い、タスク貢献度のオンライン推定を可能にする。
  • 旧データのメモリリプレイが不要な標準DNNにBN層を組み込む形で手法を実装し、アーキテクチャの変更も不要である。

実験結果

リサーチクエスチョン

  • RQ1継続的学習における標準的なEMAベースのBN更新は、どのように最近性バイアスを引き起こすのか。また、定数モーメンタムEMAの理論的限界は何か。
  • RQ2BN層における、全タスクの統計バランスと現在のタスク分布への適応の間の根本的トレードオフは何か。
  • RQ3ベイジアンベースのタスク貢献度推定は、継続的学習におけるBN統計のバランスと適応性を向上させ得るか。
  • RQ4AdaB2Nの修正モーメンタムは、長期的安定性と短期的適応の間の緊張をどのように緩和するか。
  • RQ5AdaB2Nは、オンラインおよびオフラインの継続的学習設定において、既存のBN適応戦略をどの程度上回るか。

主な発見

  • AdaB2Nは、オンラインタスクインクリメンタル学習において、Split CIFAR-10で7.68%、Split CIFAR-100で6.86%、Split Mini-ImageNetで4.26%の精度向上を達成。ベースラインBNおよび先行手法を顕著に上回る。
  • オフライン設定でも強力な性能を維持し、タスクインクリメンタル(Task-IL)ではBNより1.28%向上、クラスインクリメンタル(Class-IL)のSplit Mini-ImageNet(2000バッファ)では0.38%向上を記録。
  • アブレーションスタディにより、ベイジアン貢献度重み付けと適応的モーメンタムの両方が不可欠であることが確認され、広範なハイパーパrameter設定において一貫した性能向上が得られた。
  • BN統計の可視化結果から、AdaB2Nはジョイントトレーニングベースライン(上限)に極めて近い挙動を示す一方、標準BNおよびCN手法は時間経過とともに著しく乖離している。
  • メモリバッファ選択戦略にかかわらずロバストであり、リザボアサンプリングおよびリングバッファメモリ管理の両方で類似した性能向上を達成。
  • 他の手法(例:CN)が性能を低下させる困難なオフライン設定でも、AdaB2Nは一貫して精度を向上させ、一般化性能と安定性の優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。