Skip to main content
QUICK REVIEW

[논문 리뷰] Conditional Computation for Continual Learning

Min Lin, Jie Fu|arXiv (Cornell University)|2019. 06. 16.
Domain Adaptation and Few-Shot Learning참고 문헌 9인용 수 6
한 줄 요약

이 논문은 재난적 기억상실을 줄이기 위해 조건부 재훈련(conditional rehearsal)을 제안한다. 이 방법은 입력에 따라 부분적 파rameter 공유를 가능하게 하는 클리핑드 맥스아웃 네트워크를 기반으로 하며, 훈련 중 간섭을 겪은 예시들만 선택적으로 재훈련한다. 이 접근법은 MNIST-ol에서 기억을 잃지 않고 거의 완벽한 정확도를 달성하며, 더 작은 데이터셋에서는 랜덤 재훈련보다 뛰어난 성능을 보인다.

ABSTRACT

Catastrophic forgetting of connectionist neural networks is caused by the global sharing of parameters among all training examples. In this study, we analyze parameter sharing under the conditional computation framework where the parameters of a neural network are conditioned on each input example. At one extreme, if each input example uses a disjoint set of parameters, there is no sharing of parameters thus no catastrophic forgetting. At the other extreme, if the parameters are the same for every example, it reduces to the conventional neural network. We then introduce a clipped version of maxout networks which lies in the middle, i.e. parameters are shared partially among examples. Based on the parameter sharing analysis, we can locate a limited set of examples that are interfered when learning a new example. We propose to perform rehearsal on this set to prevent forgetting, which is termed as conditional rehearsal. Finally, we demonstrate the effectiveness of the proposed method in an online non-stationary setup, where updates are made after each new example and the distribution of the received example shifts over time.

연구 동기 및 목표

  • 조건부 계산 하에서 파라미터 공유 수준을 분석함으로써 지속적 학습에서 재난적 기억상실 문제를 해결한다.
  • 간섭 분석에 기반해 간섭을 겪은 예시들만 선택적으로 재훈련하는 방법을 개발함으로써 랜덤 재훈련보다 효율성을 높인다.
  • 클리핑드 맥스아웃 네트워크를 도입하여 학습 도중 간섭을 겪는 예시의 수를 줄임으로써 기억상실 완화를 향상시킨다.
  • 데이터가 순차적으로 도착하고 분포가 변화하는 도전적인 온라인, 비정상적인 환경에서 방법을 평가한다.

제안 방법

  • 입력 x에 따라 네트워크 파라미터 Θ(x)가 조건부로 결정되는 조건부 계산 프레임워크를 사용하여 부분적 파라미터 공유를 가능하게 한다.
  • 고정된 그룹화 함수 G(x)를 통해 다대일 매핑을 적용하여 공유 파라미터 그룹을 정의함으로써 간섭을 같은 그룹에 속한 예시들로 국한시킨다.
  • 출력값을 [0,1] 범위로 클리핑하고, 0.1 이상인 값들만 활성으로 간주하는 클리핑드 맥스아웃 네트워크를 도입함으로써 간섭을 겪는 예시의 집합을 줄인다.
  • 조건부 재훈련을 새로운 예시를 학습할 때 영향을 받는 파라미터를 가진 이전 예시들만 선택적으로 재훈련하는 것으로 정의한다.
  • 표준 교차엔트로피 손실과 조건부로 선택된 예시들에 대한 재훈련 손실을 결합한 온라인 업데이트 방식으로 훈련한다.
  • 활성값이 클리핑드 맥스아웃 유닛에서 0.1 이상인지 여부를 기준으로 간섭을 겪는 예시를 판단하기 위해 임계값(0.1)을 사용한다.

실험 결과

연구 질문

  • RQ1조건부 계산에서의 파라미터 공유는 간섭과 재난적 기억상실에 어떤 영향을 미치는가?
  • RQ2간섭 분석에 기반한 선택적 재훈련이 랜덤 재훈련보다 기억상실을 더 효율적으로 줄일 수 있는가?
  • RQ3클리핑드 맥스아웃 아키텍처는 표준 맥스아웃에 비해 간섭을 겪는 예시의 수를 줄이는가?
  • RQ4데이터 분포가 변화하는 온라인, 비정상적인 학습 환경에서 조건부 재훈련은 얼마나 효과적인가?
  • RQ5랜덤 재훈련이 커버리지가 부족해 실패하는 복잡한 데이터셋에 대해서도 이 방법은 일반화 가능한가?

주요 결과

  • 훈련 중 매 맥스아웃 유닛당 재훈련되는 예시 수는 약 100으로 유동적으로 변동하며, 이는 이론적 기대와 일치한다.
  • 전체 MNIST-ol 데이터셋에서 조건부 재훈련은 기억을 잃지 않고 100%의 훈련 정확도를 달성했고, 재훈련 없이 학습한 베이스라인은 학습에 실패했다.
  • 클래스당 10개의 예시만 포함된 작은 서브셋에서 조건부 재훈련은 랜덤 재훈련보다 뚜렷이 뛰어난 성능을 보이며, 저자원 환경에서의 이점이 입증되었다.
  • 전체 MNIST-ol에서는 랜덤 재훈련이 조건부 재훈련과 유사한 성능을 보였지만, 데이터가 희박해지면 일반화에 실패했다.
  • 클리핑드 맥스아웃 아키텍처는 간섭을 겪는 예시의 수를 줄여 더 효율적이고 정확도 높은 재훈련을 가능하게 했다.
  • 훈련 및 테스트 세트에서 모두 정확도가 단조롭게 향상되며, 기억상실 없이 안정적인 지속적 학습이 유지됨을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.