Skip to main content
QUICK REVIEW

[논문 리뷰] Localizing Catastrophic Forgetting in Neural Networks

Felix Wiewel, Bin Yang|arXiv (Cornell University)|2019. 06. 06.
Domain Adaptation and Few-Shot Learning참고 문헌 14인용 수 5
한 줄 요약

이 논문은 지속적 학습 중에 인공 신경망의 재난적 기억 상실에 기여하는 개별 신경망 가중치의 기여도를 정량화하기 위해 파rameter 수준의 국소화 방법을 제안한다. 경로 적분 기반 접근법을 사용하여, 마지막 완전 연결 층의 가중치가 특히 증분 클래스 학습에서 상실에 가장 큰 기여를 한다고 규명하였으며, 이는 잊혀지는 메커니즘에 대한 새로운 통찰을 제공하고 어려운 지속적 학습 환경에서 기존의 기울기 역학 관찰을 검증한다.

ABSTRACT

Artificial neural networks (ANNs) suffer from catastrophic forgetting when trained on a sequence of tasks. While this phenomenon was studied in the past, there is only very limited recent research on this phenomenon. We propose a method for determining the contribution of individual parameters in an ANN to catastrophic forgetting. The method is used to analyze an ANNs response to three different continual learning scenarios.

연구 동기 및 목표

  • 인공 신경망에서 재난적 기억 상실의 내부 메커니즘에 대한 연구 부족을 해결하기 위해.
  • 정확도나 손실과 같은 스칼라 메트릭을 넘어서, 개별 매개변수의 기여도를 정량화하는 방법을 개발하기 위해.
  • 증분 작업 학습(ITL), 증분 도메인 학습(IDL), 증분 클래스 학습(ICL)과 같은 다양한 지속적 학습 시나리오가 매개변수 수준의 상실에 미치는 영향을 분석하기 위해.
  • 재난적 기억 상실을 이끄는 네트워크 구성 요소를 국소화하여, 보다 정보 기반의 억제 전략 수립을 가능하게 하기 위해.

제안 방법

  • 이 방법은 지속적 학습 기간 동안 손실 변화에 기여하는 각 매개변수의 기여도를 계산하기 위해 경로 적분 접근법을 사용한다.
  • 학습 경로를 따라 손실에 대한 해당 매개변수의 기울기를 통합하여, 각 매개변수별 손실 기여도 메트릭을 정의한다.
  • 이 접근법은 각 가중치나 편향이 이전에 학습된 작업의 손실 증가에 얼마나 기여하는지 측정함으로써, 매개변수 수준의 상실 기여도를 할당할 수 있도록 한다.
  • 이 방법은 표준 CNN 아키텍처를 사용하여 벤치마크 데이터셋에서 ITL, IDL, ICL 세 가지 지속적 학습 시나리오에 적용된다.
  • 통계적 안정성을 확보하기 위해 10개의 랜덤 초기화에 걸쳐 결과를 집계하고, 평균값과 표준편차를 보고한다.
  • 가중치 행렬과 편향 벡터 모두 분석에 포함되며, 층 수준의 패턴을 식별하기 위해 추가로 뉴런/필터 평균화를 수행한다.

실험 결과

연구 질문

  • RQ1지속적 학습 중에 신경망의 어떤 개별 매개변수가 재난적 기억 상실에 가장 큰 기여를 하는가?
  • RQ2다양한 지속적 학습 시나리오(ITL, IDL, ICL) 간에 매개변수의 상실 기여도는 어떻게 달라지는가?
  • RQ3마지막 층의 매개변수들이 일관되게 더 높은 상실 기여도를 보이며, 만약 그렇다면 그 이유는 무엇인가?
  • RQ4매개변수 수준의 국소화가 시나리오 간 상실 심각도의 차이를 설명하는 패턴을 드러내는가?

주요 결과

  • 마지막 완전 연결 층의 가중치가 재난적 기억 상실에 가장 큰 기여를 하며, 특히 손실 변화의 절대값이 가장 큰 증분 클래스 학습(ICL)에서 두드러진다.
  • ICL에서는 첫 번째에서 마지막 완전 연결 층으로 갈수록 뉴런/필터의 기여도가 증가하는 반면, ITL와 IDL에서는 더 균일한 분포를 보인다.
  • 합성곱 층은 완전 연결 층보다 상실에 기여도가 낮으며, 두 번째 합성곱 층은 시나리오 전반에서 평균 손실 감소를 보이기도 한다.
  • 손실 기여도의 분산은 ICL에서 가장 높으며, 특히 마지막 층에서 높아서 이 시나리오의 더 큰 불안정성과 민감도를 시사한다.
  • 이 방법은 ICL이 IDL보다 더 많은 상실을 유도하는 것으로 이전 관찰을 지지하며, 이는 마지막 층에서 더 큰 기울기 크기를 가지기 때문이며, 이제는 특정 매개변수에 국소화된 결과로 확인된다.
  • 편향 벡터는 가중치 행렬에 비해 상실에 거의 기여하지 않아, 가중치 갱신이 재난적 기억 상실의 주요 원인임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.