Skip to main content
QUICK REVIEW

[논문 리뷰] On the Soft-Subnetwork for Few-shot Class Incremental Learning

Haeyong Kang, Jaehong Yoon|arXiv (Cornell University)|2022. 09. 15.
Domain Adaptation and Few-Shot Learning인용 수 12
한 줄 요약

이 논문은 정규화된 룩업 티켓 가설에 영감을 받은 소프트 서브넷을 활용하여 치명적인 잊음과 과적합을 동시에 완화하는 소프트넷(SoftNet)을 제안한다. 적응형 비이진 소프트 마스크를 통해 주 서브넷은 이전 지식을 유지하고 보조 서브넷은 소수의 샘플로 적응하도록 설계함으로써, SoftNet은 miniImageNet 및 CIFAR-100 벤치마크에서 최신 기술(SOTA) 성능을 달성하며, 이전 방법들보다 최대 +5.63%의 정확도 향상을 보였다.

ABSTRACT

Inspired by Regularized Lottery Ticket Hypothesis (RLTH), which hypothesizes that there exist smooth (non-binary) subnetworks within a dense network that achieve the competitive performance of the dense network, we propose a few-shot class incremental learning (FSCIL) method referred to as \emph{Soft-SubNetworks (SoftNet)}. Our objective is to learn a sequence of sessions incrementally, where each session only includes a few training instances per class while preserving the knowledge of the previously learned ones. SoftNet jointly learns the model weights and adaptive non-binary soft masks at a base training session in which each mask consists of the major and minor subnetwork; the former aims to minimize catastrophic forgetting during training, and the latter aims to avoid overfitting to a few samples in each new training session. We provide comprehensive empirical validations demonstrating that our SoftNet effectively tackles the few-shot incremental learning problem by surpassing the performance of state-of-the-art baselines over benchmark datasets.

연구 동기 및 목표

  • 소수의 샘플로만 학습되는 클래스 증강 지속 학습(FSCIL) 환경에서 모델의 성능 저하를 악화시키는 한정된 클래스 당 학습 샘플로 인해 발생하는 치명적인 잊음과 과적합이라는 이중 과제를 해결하기 위해.
  • 이전에 학습된 클래스의 지식을 유지하면서도, 소수의 예시로만 새로운 클래스를 효과적으로 학습할 수 있는 방법을 개발하기 위해.
  • 정규화된 룩업 티켓 가설에서 영감을 받은 새로운 마스킹 기반 파라다임을 도입하여, 효율적이고 안정적인 지속 학습을 가능하게 하기 위해.
  • 지식 유지와 지속적 적응을 분리하는 모델 가중치와 적응형 비이진 소프트 마스크를 동시에 학습하는 것을 목표로 하기 위해.
  • 기존의 최고 성능 기준 방법들과 비교하여 표준 벤치마크에서 실험적으로 검증함으로써, 기존의 SOTA 접근법보다 뛰어난 성능을 입증하기 위해.

제안 방법

  • 기본 세션 동안 소프트 마스크 $\bm{m} \in [0,1]^{|m{\theta}|}$ 를 학습 가능한 것으로 설정한 밀집 신경망을 훈련한다. 여기서 $m=1$ 인 경우 상위-$c\%$ 파라미터(주 서브넷)에 해당하고, $m<1$ 인 경우 나머지 부분(보조 서브넷)에 해당한다.
  • 기본 훈련 후 주 서브넷은 동결되어 이전 지식을 유지하고, 보조 서브넷은 지속 학습 세션 동안 업데이트되어 새로운 클래스에 적응한다.
  • 소프트 마스크는 기본 훈련 기간 동안 종단 간(end-to-end)으로 학습되며, 주 부분은 안정성을 확보하고 보조 부분은 소수의 샘플 데이터에 대한 민감한 적응을 가능하게 한다.
  • 이 방법은 동일한 초기 밀집 신경망에서 유도된 두 개의 브랜치 서브넷 아키텍처를 사용한다: 하나는 지속적인 지식 유지 전용이고, 다른 하나는 지속적 학습 전용이다.
  • 이 방법은 이진 마스킹을 피하고 연속적이고 미분 가능한 마스크를 사용함으로써 부드러운 기울기 업데이트와 더 나은 일반화 성능를 가능하게 한다.
  • 이 방법은 과거 데이터에 접근할 수 없고, 각 세션에서 클래스당 소수의 샘플만 제공되는 클래스 증강 설정에서 적용된다.

실험 결과

연구 질문

  • RQ1적응형 비이진 마스크를 가진 소프트 서브넷이 소수의 샘플로 지속 학습하는 환경에서 치명적인 잊음을 효과적으로 방지할 수 있는가?
  • RQ2제안된 방법이 이전에 학습된 클래스의 지식을 유지하면서도 소수의 샘플 데이터에 대한 과적합을 동시에 줄일 수 있는가?
  • RQ3다양한 소수의 샘플 벤치마크와 하이퍼파라미터 설정에서 SoftNet의 성능가 기존의 최고 성능 기준 방법들과 비교해 볼 때 어떻게 되는가?
  • RQ4주 서브넷 파라미터 비율인 $c\%$ 의 선택이 지속 학습 세션 동안 모델의 안정성과 정확도에 크게 영향을 미치는가?
  • RQ5정규화된 룩업 티켓 가설을 소수의 샘플 지속 학습 환경으로 확장하여 안정적이고 효율적이며 정확한 지속적 적응을 가능하게 할 수 있는가?

주요 결과

  • ResNet20를 사용할 때 $c=80\%$ 인 경우, SoftNet은 가장 강력한 베이스라인(cRT)보다 +5.63%의 정확도 향상을 보이며 miniImageNet에서 뛰어난 성능을 달성했다.
  • $c=97\%$ 일 때 SoftNet은 첫 번째 세션에서 77.17%의 정확도를 기록하고 아홉 번째 세션에서는 50.24%를 기록하여 강력한 안정성과 최소한의 잊음 정도를 보였다.
  • ResNet18를 사용함에도 불구하고, SoftNet은 FSLL, iCaRL 및 Rebuffi et al. (2017) 보다 miniImageNet에서 최대 +5.39%의 정확도 향상을 기록했다.
  • 모든 세션에서 일관되게 성능 향상을 보였으며, ResNet20에서 $c=80\%$ 일 때 가장 큰 정확도 향상인 +5.63% 가 관찰되었다.
  • $c=90\%$ 일 때 SoftNet은 첫 번째 세션에서 77.00%의 정확도를 기록하고 아홉 번째 세션에서는 50.39%를 달성하여, 하드넷 변종을 포함한 모든 베이스라인을 능가했다.
  • 제거 실험 결과, 비이진, 적응형 마스크를 사용한 소프트 마스킹이 이진 또는 고정 마스킹 전략에 비해 과적합과 잊음이 크게 감소하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.