Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Architecture Search for Class-incremental Learning

Shenyang Huang, Vincent François-Lavet|arXiv (Cornell University)|2019. 09. 14.
Domain Adaptation and Few-Shot Learning참고 문헌 22인용 수 10
한 줄 요약

이 논문은 강화학습 메타컨트롤러와 Net2Net 가중치 전이를 통해 계층적 증강 학습에서 신경망 아키텍처를 동적으로 진화시키는 Continual Neural Architecture Search (CNAS)를 제안한다. CNAS는 고정 아키텍처 모델을 능가하며, 이전 NAS 방법들보다 최소 한 계단 더 효율적이어서 필요에 따라 유일하게 확장함으로써 파라미터 증가를 최소화하면서도 뛰어난 정확도를 달성한다.

ABSTRACT

In class-incremental learning, a model learns continuously from a sequential data stream in which new classes occur. Existing methods often rely on static architectures that are manually crafted. These methods can be prone to capacity saturation because a neural network's ability to generalize to new concepts is limited by its fixed capacity. To understand how to expand a continual learner, we focus on the neural architecture design problem in the context of class-incremental learning: at each time step, the learner must optimize its performance on all classes observed so far by selecting the most competitive neural architecture. To tackle this problem, we propose Continual Neural Architecture Search (CNAS): an autoML approach that takes advantage of the sequential nature of class-incremental learning to efficiently and adaptively identify strong architectures in a continual learning setting. We employ a task network to perform the classification task and a reinforcement learning agent as the meta-controller for architecture search. In addition, we apply network transformations to transfer weights from previous learning step and to reduce the size of the architecture search space, thus saving a large amount of computational resources. We evaluate CNAS on the CIFAR-100 dataset under varied incremental learning scenarios with limited computational power (1 GPU). Experimental results demonstrate that CNAS outperforms architectures that are optimized for the entire dataset. In addition, CNAS is at least an order of magnitude more efficient than naively using existing autoML methods.

연구 동기 및 목표

  • 고정된 수동 설계 아키텍처에 의존하지 않고, 동적으로 신경망 아키텍처를 적응시킴으로써 지속적 학습에서 용량 포화 문제를 해결하는 것.
  • 인간의 간섭 없이 각 학습 단계에서 최적의 아키텍처를 자동으로 선택하는 자동ML 시스템을 개발하는 것.
  • Net2Net를 통한 가중치 전이와 히우리스틱 기반 확장 전략을 활용하여 아키텍처 탐색의 계산 비용을 줄이는 것.
  • 제한된 GPU 자원과 실제 데이터 제약 조건 하에서 지속적 아키텍처 탐색의 효과성을 평가하는 것.
  • 적응적 아키텍처 진화가 정적 또는 탐욕적 확장 전략보다 더 우수한 일반화 능력과 파라미터 효율성을 제공하는지 입증하는 것.

제안 방법

  • 현재 작업용 네트워크에서 아키텍처 변환(Net2WiderNet, Net2DeeperNet)을 탐색하기 위해 강화학습 에이전트를 메타컨트롤러로 사용한다.
  • 이전 아키텍처의 훈련된 가중치를 전이하기 위해 Net2Net 변환을 적용하여 훈련 시간과 계산 비용을 크게 감소시킨다.
  • 과도한 파라미터화와 불필요한 복잡성을 방지하기 위해 네트워크 확장을 결정하는 히우리스틱 함수를 사용한다.
  • 모든 이전에 본 클래스에 대해 가장 높은 성능을 보이는 아키텍처를 선택하기 위해 각 타임스텝에서 보류된 검증 세트에서 아키텍처 탐색을 수행한다.
  • 지속적인 잊힘 방지를 위해 과거 데이터 전체의 증가하는 데이터셋을 유지하고 지식 재연기를 사용한다.
  • 타임스텝당 최대 30개의 아키텍처를 샘플링하고, 탐색 공간 크기를 제어하기 위해 Net2WiderNet 및 Net2DeeperNet 연산을 각각 5회 이내로 제한한다.

실험 결과

연구 질문

  • RQ1고정 아키텍처 모델과 비교해 동적 아키텍처 탐색이 계층적 증강 학습에서 성능 향상에 기여하는가?
  • RQ2강화학습과 가중치 전이의 조합이 지속적 아키텍처 탐색에서 계산 비용을 어떻게 줄이는가?
  • RQ3히우리스틱 함수가 지속적 학습에서 과도한 파라미터화를 방지하고 일반화 능력을 향상시키는 데 어떤 영향을 미치는가?
  • RQ4CNAS는 NAS나 EAS와 같은 난이도 높은 자동ML 방법들과 비교해 효율성과 정확도 면에서 어떻게 다른가?
  • RQ5RL 메타컨트롤러는 히우리스틱 전용 또는 탐욕적 접근보다 변화하는 데이터 분포에 더 잘 적응할 수 있는가?

주요 결과

  • CNAS는 전체 CIFAR-100 데이터셋에서 최적화된 모델을 능가하며, 지속적 아키텍처 탐색이 더 우수한 일반화 능력을 이끌어낸다는 것을 입증한다.
  • CNAS는 난이도 높은 NAS 및 EAS 방법보다 최소 한 계단 더 효율적이며, 1개의 GPU만을 사용해 900개의 아키텍처에 대해 93시간 만에 훈련을 완료한다.
  • 히우리스틱 함수는 조기 및 과도한 모델 확장을 방지하여 과적합을 줄이고 훈련 비용을 감소시킨다.
  • RL 메타컨트롤러 덕분에 CNAS는 시간이 지남에 따라 효과적인 탐색 정책을 학습하며, 36개의 클래스를 학습한 후 RAS-HF(메타컨트롤러가 없는 경우)를 능가하는 성능을 보인다.
  • 절단 실험에서 메타컨트롤러와 히우리스틱 함수를 모두 갖춘 CNAS는 RAS보다 더 낮은 파라미터 증가율로 가장 뛰어난 성능을 달성하며, 탐욕적 확장을 하는 RAS는 계산적으로 비현실적이 된다.
  • 매개변수 증가 곡선과 성능 비교도 보여주듯이, CNAS는 SA(정적 아키텍처)보다 더 높은 정확도를 달성하면서도 훨씬 적은 파라미터를 사용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.