Skip to main content
QUICK REVIEW

[논문 리뷰] Routing Networks with Co-training for Continual Learning

Mark Collier, Efi Kokiopoulou|arXiv (Cornell University)|2020. 09. 09.
Domain Adaptation and Few-Shot Learning참고 문헌 24인용 수 9
한 줄 요약

이 논문은 연속 학습에서 치명적인 잊음 현상을 최소화하기 위해 작업별 전문가 라우팅을 활용하는 희소 라우팅 네트워크와 공학습을 제안한다. 유사한 작업은 공유 전문가로 라우팅하고, 비유사한 작업은 분리된 전문가로 라우팅함으로써 간섭을 줄이고, 소규모 에피소딕 메모리 버퍼를 사용하여 MNIST-Permutations 및 MNIST-Rotations 벤치마크에서 성능을 향상시킨다.

ABSTRACT

The core challenge with continual learning is catastrophic forgetting, the phenomenon that when neural networks are trained on a sequence of tasks they rapidly forget previously learned tasks. It has been observed that catastrophic forgetting is most severe when tasks are dissimilar to each other. We propose the use of sparse routing networks for continual learning. For each input, these network architectures activate a different path through a network of experts. Routing networks have been shown to learn to route similar tasks to overlapping sets of experts and dissimilar tasks to disjoint sets of experts. In the continual learning context this behaviour is desirable as it minimizes interference between dissimilar tasks while allowing positive transfer between related tasks. In practice, we find it is necessary to develop a new training method for routing networks, which we call co-training which avoids poorly initialized experts when new tasks are presented. When combined with a small episodic memory replay buffer, sparse routing networks with co-training outperform densely connected networks on the MNIST-Permutations and MNIST-Rotations benchmarks.

연구 동기 및 목표

  • 순차적으로 훈련될 때 이전에 학습한 작업에서 성능이 저하되는 연속 학습에서의 치명적인 잊음 현상을 해결하기 위해.
  • 작업 수에 따라 네트워크 크기가 선형적으로 증가하지 않는 고정 용량 아키텍처를 개발하기 위해.
  • 유사한 작업 간의 긍정적 전이를 가능하게 하면서도, 비유사한 작업 간의 간섭을 최소화하기 위해.
  • 연속 학습 중에 사용되지 않는 전문가의 초기화가 불량해지는 문제를 해결하기 위해, 이는 최적의 라우팅과 간섭을 유발할 수 있다.
  • 라우팅 네트워크와 에피소딕 메모리 재생 버퍼를 조합하여 연속 학습에서의 안정성과 성능을 향상시키기 위해.

제안 방법

  • 각 레이어당 다수의 전문가를 갖는 희소 라우팅 네트워크 아키텍처를 사용하며, 각 전문가는 완전히 연결된 피드포워드 네트워크이다.
  • 작업 ID에 따라 조정되는 라우팅 행렬을 사용하여 입력당 활성화되는 전문가를 결정함으로써, 희소하고 작업별로 특화된 라우팅을 가능하게 한다.
  • 공학습을 도입: 새로운 작업을 훈련하는 동안, 예측된 예제들이 사용되지 않는 전문가를 통해도 전달되어, 이들이 계속 훈련되지 않은 채로 남는 것을 방지한다.
  • 라우팅 확률을 마스크로 사용하여 활성화된 전문가만 업데이트하는 확률적 경사 하강법을 적용함으로써, 기울기 간섭을 줄인다.
  • 소규모 에피소딕 메모리 재생 버퍼(크기 1,000)와 함께 라우팅 네트워크를 조합하여 학습의 안정성을 추가로 향상시킨다.
  • 라우팅 행렬을 자기 자신과 행렬 곱셈하여 작업 유사도를 추론하고, 라우팅 패턴을 작업 임베딩으로 시각화한다.

실험 결과

연구 질문

  • RQ1희소 라우팅 네트워크가 유사한 작업을 공유 전문가로 라우팅함으로써 연속 학습에서 치명적인 잊음 현상을 줄일 수 있는가?
  • RQ2공학습이 연속 학습 중에 사용되지 않는 전문가의 열악한 초기화를 효과적으로 방지하는가?
  • RQ3연속 학습 벤치마크에서 라우팅 네트워크 성능이 표준 공유 바닥 아키텍처와 비교해 어떻게 되는가?
  • RQ4라우팅 행렬이 MNIST-Rotations에서 증가하는 회전 각도에 따라 의미 있는 작업 유사도를 포착할 수 있는가?
  • RQ5라우팅 네트워크와 에피소딕 메모리를 조합하면 평균 정확도가 향상되고 부정적 후방 전이가 감소하는가?

주요 결과

  • 공학습을 적용한 라우팅 네트워크는 MNIST-Permutations 및 MNIST-Rotations 벤치마크에서 공유 바닥 아키텍처보다 높은 평균 정확도를 달성했다.
  • 이 방법은 부정적 후방 전이를 크게 줄였으며, 시간이 지남에 따라 작업 정확도 곡선이 더 평탄하게 유지되어 초기 작업의 기억 상실이 적음을 시사한다.
  • MNIST-Rotations에서 라우팅 행렬은 추론된 작업 유사도 행렬에서 블록 대각형 구조를 보였으며, 유사한 작업(근접한 각도에서의 회전)이 전문가를 공유하고 있음을 확인했다.
  • 비유사한 회전 각도(예: 0°와 180°)를 가진 작업들은 대부분 전문가 집합이 분리되어 있어 간섭을 최소화하고, 부정적 전이를 방지하는 설계 목표를 지원한다.
  • 약간 낮은 초기 샘플 효율성에도 불구하고, 라우팅 네트워크는 모든 작업에서 안정된 성능을 유지했으며, 장기적인 연속 학습에서 공유 바닥 모델을 능가했다.
  • 라우팅 확률을 통한 작업 임베딩 학습 능력 덕분에, 라우팅 네트워크는 MNIST-Rotations의 기대되는 기하학적 관계와 일치하는 해석 가능한 작업 유사도 클러스터링을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.