Skip to main content
QUICK REVIEW

[논문 리뷰] Learnable Expansion-and-Compression Network for Few-shot Class-Incremental Learning

Boyu Yang, Mingbao Lin|arXiv (Cornell University)|2021. 04. 06.
Domain Adaptation and Few-Shot Learning참고 문헌 37인용 수 4
한 줄 요약

이 논문은 소수의 예시로 학습하는 클래스 증분 학습(FSCIL)을 위한 통합 프레임워크인 유연한 확장 및 압축 네트워크(LEC-Net)를 제안한다. LEC-Net은 모델 정규화를 통해 치명적인 잊음 문제를 완화하고, 압축을 통해 과적합을 줄이기 위해 네트워크 노드를 동적으로 확장한다. LEC-Net은 SOTA 기준으로 CUB 및 CIFAR-100에서 각각 5–7%의 정확도 향상을 달성하여 최신 기술 수준을 초월한다.

ABSTRACT

Few-shot class-incremental learning (FSCIL), which targets at continuously expanding model's representation capacity under few supervisions, is an important yet challenging problem. On the one hand, when fitting new tasks (novel classes), features trained on old tasks (old classes) could significantly drift, causing catastrophic forgetting. On the other hand, training the large amount of model parameters with few-shot novel-class examples leads to model over-fitting. In this paper, we propose a learnable expansion-and-compression network (LEC-Net), with the aim to simultaneously solve catastrophic forgetting and model over-fitting problems in a unified framework. By tentatively expanding network nodes, LEC-Net enlarges the representation capacity of features, alleviating feature drift of old network from the perspective of model regularization. By compressing the expanded network nodes, LEC-Net purses minimal increase of model parameters, alleviating over-fitting of the expanded network from a perspective of compact representation. Experiments on the CUB/CIFAR-100 datasets show that LEC-Net improves the baseline by 5~7% while outperforms the state-of-the-art by 5~6%. LEC-Net also demonstrates the potential to be a general incremental learning approach with dynamic model expansion capability.

연구 동기 및 목표

  • 소수의 예시로 학습하는 클래스 증분 학습(FSCIL)에서, 새로운 클래스에 대해 소수의 예시가 기존 클래스의 학습된 표현을 불안정하게 만들 가능성이 있는 치명적인 잊음과 모델 과적합이라는 이중 과제를 해결한다.
  • 기존 클래스의 특징 이탈과 소수의 예시로 인한 과적합을 동시에 완화하는 통합 프레임워크를 개발한다.
  • 고정된 아키텍처나 메모리 버퍼에 의존하지 않고, 증분 학습 중에 동적으로 적응 가능한 모델 확장 및 압축을 가능하게 한다.
  • LEC-Net을 일반 증분 학습 작업으로까지 일반화 가능성을 입증한다.

제안 방법

  • 학습 중에 노드를 확장하여 네트워크 용량을 일시적으로 증가시켜 표현 능력을 향상시키는 학습 가능한 확장 및 압축 메커니즘을 도입한다.
  • 노드 출력에 비선형 활성화를 적용하여 지시자 벡터를 계산하는 자기 활성화 모듈을 도입하여 비활성화된 노드를 자동으로 정리한다.
  • 지시자 벡터를 사용해 확장된 노드를 미분 가능하고 종단 간 훈련이 가능한 방식으로 압축함으로써 최소한의 파라미터 증가와 효율적인 특징 학습을 보장한다.
  • 딥 네트워크(예: ResNet-18)에 확장-압축 모듈을 플러그인 모듈로 통합하여 증분 적응을 가능하게 한다.
  • 기존 클래스 표현의 안정성을 확보하기 위해 특징 정규화를 적용한 표준 교차 엔트로피 손실을 사용해 네트워크를 훈련시킨다.
  • 증분 세션 동안 네트워크 폭을 동적으로 조정하며, 새로운 클래스 학습 전에 확장하고 학습 후에 압축하여 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1동적인 학습 가능한 네트워크 확장 기법이 소수의 예시로 학습하는 클래스 증분 학습에서 표현 능력 향상과 특징 이탈 감소에 기여하는가?
  • RQ2자기 활성화 압축 기법이 소수의 예시로 학습된 네트워크에서 과적합을 효과적으로 줄일 수 있는가?
  • RQ3제안된 LEC-Net 프레임워크가 증분 세션 전반에 걸쳐 정확도와 안정성 측면에서 기존 SOTA 기법을 초월하는가?
  • RQ4LEC-Net은 소수의 예시 설정을 넘어서 일반 클래스 증분 학습 작업으로까지 일반화 가능한가?

주요 결과

  • CUB200에서 LEC-Net은 평균 정확도 31.96%를 기록하여 이전 SOTA(TOPIC)보다 5.68% 높고, NCM보다는 12.09% 높다.
  • CIFAR-100에서 LEC-Net은 평균 정확도 34.73%를 달성하여 NCM보다 21.19% 높고, TOPIC보다는 5.36% 높다.
  • CIFAR-100에서 초기 세션에서 확장으로 인한 과적합으로 인해 일시적인 성능 저하가 있었지만, 효과적인 압축 덕분에 후속 세션에서 회복되고 성능 향상을 보였다.
  • Seq-MNIST에서 일반 증분 학습 작업을 수행한 결과, LEC-Net은 19.90%의 정확도를 기록하여 LwF(19.62%)와 DER(19.61%)를 각각 0.28%, 0.29% 높게 기록했다.
  • 제거 실험 결과, 확장 및 압축 구성 요소 모두가 필수적임을 확인하였으며, 둘 중 하나를 제거하면 성능이 크게 저하됨을 입증했다.
  • LEC-Net은 다양한 벤치마크와 증분 설정에서 뛰어난 강인성을 보이며, 실제 지속적 학습 환경에서의 적응성과 효과성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.