Skip to main content
QUICK REVIEW

[논문 리뷰] Overcoming Recency Bias of Normalization Statistics in Continual Learning: Balance and Adaptation

Yilin Lyu, Liyuan Wang|arXiv (Cornell University)|2023. 10. 13.
Domain Adaptation and Few-Shot LearningComputer Science인용 수 3
한 줄 요약

이 논문은 지속적 학습 중 배치 정규화(BN)의 최근성 편향을 극복하기 위한 새로운 방법인 AdaB2N을 제안한다. 이 방법은 역사적 및 현재 작업 통계를 적응적으로 균형 조절함으로써 성능을 햖थ한다. 작업별 기여도 가중치 부여에 베이지안 기반 전략을 결합하고 수정된 운동량 업데이트를 적용하여, 온라인 및 오프라인 지속적 학습 벤치마크에서 최신 기술 수준의 성능을 달성한다. Split CIFAR-10에서 최대 7.68%의 정확도 향상을 기록한다.

ABSTRACT

Continual learning entails learning a sequence of tasks and balancing their knowledge appropriately. With limited access to old training samples, much of the current work in deep neural networks has focused on overcoming catastrophic forgetting of old tasks in gradient-based optimization. However, the normalization layers provide an exception, as they are updated interdependently by the gradient and statistics of currently observed training samples, which require specialized strategies to mitigate recency bias. In this work, we focus on the most popular Batch Normalization (BN) and provide an in-depth theoretical analysis of its sub-optimality in continual learning. Our analysis demonstrates the dilemma between balance and adaptation of BN statistics for incremental tasks, which potentially affects training stability and generalization. Targeting on these particular challenges, we propose Adaptive Balance of BN (AdaB$^2$N), which incorporates appropriately a Bayesian-based strategy to adapt task-wise contributions and a modified momentum to balance BN statistics, corresponding to the training and testing stages. By implementing BN in a continual learning fashion, our approach achieves significant performance gains across a wide range of benchmarks, particularly for the challenging yet realistic online scenarios (e.g., up to 7.68%, 6.86% and 4.26% on Split CIFAR-10, Split CIFAR-100 and Split Mini-ImageNet, respectively). Our code is available at https://github.com/lvyilin/AdaB2N.

연구 동기 및 목표

  • 최근 작업 통계가 경량 및 통계 업데이트로 인해 지배하는 지속적 학습 중 배치 정규화(BN) 통계의 최근성 편향을 해결한다.
  • BN에서 이전 작업 통계의 균형 조절과 현재 작업 분포에의 적응 사이의 본질적 상충 관계를 규명한다.
  • 구형 데이터를 활용하지 않고도 동적으로 BN 통계를 조정함으로써 학습 안정성과 일반화 능력을 유지하는 방법을 개발한다.
  • 특히 클래스 인크리멘탈 및 작업 인크리멘탈 시나리오에서 온라인(일회성) 및 오프라인(다중 에포크) 지속적 학습 설정 모두에서 뛰어난 성능을 달성한다.
  • 제한된 이전 데이터 접근 조건에서 실생활 지속적 학습에 적용 가능한 이론적으로 탄탄하고 확장 가능한 해결책을 제공한다.

제안 방법

  • 활성화 통계에 조건부된 작업 정체성에 대한 이항 분포를 사용하여, 작업별 기여도를 추정하는 베이지안 기반 전략을 도입한다.
  • 추정된 작업 기여도에 기반해 조정되는 수정된 지수이동평균(EMA) 운동량을 제안하여 안정성과 적응성 사이의 균형을 맞춘다.
  • 학습 및 추론 단계를 분리한다: 학습 시에는 적응형 운동량을 사용해 학습을 안정화하고, 추론 시에는 균형 잡힌 역사 인지 BN 통계 추정치를 유지한다.
  • 신규 작업 통계가 BN에 미치는 영향을 제어하기 위해 하이퍼파라미터 λ를 포함한 정규화 항을 통합하여 부드러운 적응을 보장한다.
  • 계산 효율성을 높이기 위해 작업 분포를 근사하기 위해 딜리클레 사전을 사용하여 작업 기여도의 온라인 추정을 가능하게 한다.
  • 기존 DNN에 BN 레이어를 사용해 구현하며, 아키텍처 변경이나 이전 샘플의 메모리 재생이 필요하지 않다.

실험 결과

연구 질문

  • RQ1지속적 학습에서 표준 EMA 기반 BN 업데이트가 최근성 편향을 유도하는 방식과 일정 운동량 EMA의 이론적 한계는 무엇인가?
  • RQ2BN 레이어에서 모든 작업의 통계 균형 조절과 현재 작업 분포에의 적응 사이의 근본적 상충 관계는 무엇인가?
  • RQ3베이지안 기반 작업 기여도 추정이 지속적 학습에서 BN 통계의 균형과 적응성 향상에 기여할 수 있는가?
  • RQ4AdaB2N의 수정된 운동량이 장기적 안정성과 단기적 적응 사이의 갈등을 어떻게 해소하는가?
  • RQ5AdaB2N는 온라인 및 오프라인 지속적 학습 설정에서 기존 BN 적응 전략보다 얼마나 뛰어나게 성능을 발휘하는가?

주요 결과

  • AdaB2N는 온라인 작업 인크리멘탈 학습에서 Split CIFAR-10에서 최대 7.68% 향상, Split CIFAR-100에서 6.86%, Split Mini-ImageNet에서 4.26%의 정확도 향상을 기록하며, 베이스라인 BN 및 이전 방법들을 크게 능가한다.
  • 오프라인 설정에서도 뛰어난 성능을 유지하며, Task-IL에서 BN 대비 1.28% 향상, Class-IL에서 Split Mini-ImageNet(2000 메모리 버퍼)에서 0.38% 향상되었다.
  • 제거 실험 결과, 베이지안 기여도 가중치와 적응형 운동량이 모두 필수적임을 확인하였으며, 다양한 하이퍼파라미터 조합에서 일관된 성능 향상이 관찰되었다.
  • BN 통계의 시각화 결과, AdaB2N는 공동 학습 베이스라인(상한선)과 유사한 결과를 보였지만, 표준 BN 및 CN 방법은 시간이 지남에 따라 크게 벗어나는 것으로 나타났다.
  • 메모리 버퍼 선택 전략에 대해 강건하며, 레저보어 샘플링 및 링 버퍼 메모리 관리 모두에서 유사한 성능 향상을 제공한다.
  • 기타 방법들이 성능이 저하되는 어려운 오프라인 설정에서도 AdaB2N는 일관되게 정확도를 향상시켜 일반화 능력과 안정성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.