Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Architecture Search for Continual Learning

Qiang Gao, Zhipeng Luo|arXiv (Cornell University)|2020. 06. 07.
Domain Adaptation and Few-Shot Learning참고 문헌 24인용 수 4
한 줄 요약

CLEAS는 최소한의 복잡도로 동적으로 신경망을 확장하는 데 있어 뉴런 수준의 신경망 아키텍처 탐색(NAS)을 사용하는 혁신적인 지속적 학습 프레임워크를 제안한다. 이는 오래된 뉴런 중 가장 유용한 것들만 재사용하고 새로운 뉴런을 최소한으로 추가함으로써, 기존의 최상위 성능(SOTA) 방법 대비 최대 51%까지 모델 복잡도를 감소시키면서도 최상의 정확도를 달성하며, 고정된 이전 가중치 덕분에 치명적인 기억 상실(catastrophic forgetting)이 발생하지 않는다.

ABSTRACT

Continual learning with neural networks is an important learning framework in AI that aims to learn a sequence of tasks well. However, it is often confronted with three challenges: (1) overcome the catastrophic forgetting problem, (2) adapt the current network to new tasks, and meanwhile (3) control its model complexity. To reach these goals, we propose a novel approach named as Continual Learning with Efficient Architecture Search, or CLEAS in short. CLEAS works closely with neural architecture search (NAS) which leverages reinforcement learning techniques to search for the best neural architecture that fits a new task. In particular, we design a neuron-level NAS controller that decides which old neurons from previous tasks should be reused (knowledge transfer), and which new neurons should be added (to learn new knowledge). Such a fine-grained controller allows one to find a very concise architecture that can fit each new task well. Meanwhile, since we do not alter the weights of the reused neurons, we perfectly memorize the knowledge learned from previous tasks. We evaluate CLEAS on numerous sequential classification tasks, and the results demonstrate that CLEAS outperforms other state-of-the-art alternative methods, achieving higher classification accuracy while using simpler neural architectures.

연구 동기 및 목표

  • 지속적 학습의 세 핵심 과제인 치명적인 기억 상실, 새로운 작업에 대한 효과적 적응, 모델 복잡도 통제를 해결하기 위해.
  • 모든 작업에서 높은 성능를 유지하면서도 아키텍처를 최소한으로 확장하는 동적 네트워크 확장 전략을 개발하기 위해.
  • 모든 이전에 학습된 가중치를 유지하고 재학습 없이 고정함으로써 치명적인 기억 상실을 완전히 제거하기 위해.
  • 정확하고 효율적인 아키텍처 선택을 위해 뉴런 수준에서 작동하는 NAS 컨트롤러를 설계하기 위해.
  • 특히 순차적 학습 환경에서 성능을 훼손하지 않으면서도 네트워크 복잡도를 감소시키기 위해.

제안 방법

  • 강화학습 기반의 NAS 컨트롤러가 뉴런 수준에서 작동하여 각 새로운 작업에 대해 어떤 오래된 뉴런을 재사용할지와 얼마나 많은 새로운 뉴런을 추가할지 결정한다.
  • 컨트롤러는 전체 네트워크 구성 전체를 상태로 사용하여, 개별 뉴런 상태 정의보다 더 정보가 풍부한 결정을 내릴 수 있다.
  • 오래된 뉴런 가중치는 고정되어 있어 완벽한 지식 유지가 보장되며, 치명적인 기억 상실이 발생하지 않는다.
  • 이 방법은 CNN에서 필터 크기 최적화를 지원하여, 각 작업에 따라 커널 크기를 동적으로 조정할 수 있다.
  • 아키텍처 탐색은 각 작업별로 수행되어, 재사용과 확장을 균형 잡은 작고 전용 최적화된 네트워크를 생성한다.
  • 이 접근법은 순차적 분류 작업, 즉 MNIST 순열 및 CIFAR-100을 대상으로 평가되었으며, 컨트롤러 설계와 하이퍼파rameter 민감도에 대한 분석도 포함되어 있다.

실험 결과

연구 질문

  • RQ1기존 방법 대비 더 낮은 모델 복잡도로 더 높은 지속적 학습 성능을 달성하기 위해 뉴런 수준의 NAS 컨트롤러가 가능할까?
  • RQ2고정된 이전 가중치를 유지함으로써 치명적인 기억 상실은 완전히 제거되며, 同시에 효과적인 새로운 작업 적응이 가능할까?
  • RQ3CNN에서의 동적 필터 크기 조정이 복잡도를 크게 증가시키지 않으면서도 성능 향상에 기여할 수 있을까?
  • RQ4컨트롤러 상태 표현 방식의 선택(전체 네트워크 대비 단일 뉴런)이 탐색 성능에 어떤 영향을 미칠까?
  • RQ5기존 접근법 대비 하이퍼파rameter 변화에 대해 제안된 방법이 얼마나 강인한가?

주요 결과

  • CLEAS는 세 가지 벤치마크 데이터셋에서 SOTA 방법인 RCL 대비 각각 0.21%, 0.21%, 6.70% 높은 분류 정확도를 확보했다.
  • 동일한 데이터셋에서 CLEAS는 RCL 대비 네트워크 복잡도를 각각 29.9%, 19.0%, 51.0% 감소시켰다.
  • 컨트롤러가 전체 네트워크를 상태로 사용함으로써 세 데이터셋에서 각각 0.31%, 0.29%, 0.75% 향상된 성능를 달성했다.
  • 필터 크기 최적화를 수행하는 CLEAS-C는 CIFAR-100에서 67.4%의 정확도를 달성하여 CLEAS(66.9%) 대비 0.7% 향상되었지만, 복잡도는 92.6% 높아졌다.
  • CLEAS와 RCL는 각 작업당 추가하는 새로운 뉴런 수가 유사하지만, CLEAS는 오래된 뉴런을 훨씬 더 적게 재사용하여 유용한 이전 지식을 더 정교하게 선택하는 것으로 나타났다.
  • 하이퍼파rameter 민감도 분석 결과, CLEAS는 DEN 및 RCL보다 민감도가 낮아 모든 테스트 설정에서 높은 성능를 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.