[논문 리뷰] Dissecting Catastrophic Forgetting in Continual Learning by Deep Visualization
이 논문은 예측 차이 분석과 IoU 기반의 忘却 측정을 활용하여 지속적 학습 중 깊이 신경망의 가장 유연한(잊기 쉬운) 구성 요소를 특정함으로써 치명적인 忘却 현상을 시각화 기반으로 분석하는 새로운 방법인 Auto DeepVis를 소개한다. 특히 ResNet-50의 블록 3 및 4에서 심한 활성화 이탈이 발생하는 것으로 밝혀졌으며, 이들 레이어만을 동결하는 제안된 핵심 동결 기법이 이전 및 신규 작업 모두에서 베이스라인을 능가하는 우수한 성능을 기록한다.
Interpreting the behaviors of Deep Neural Networks (usually considered as a black box) is critical especially when they are now being widely adopted over diverse aspects of human life. Taking the advancements from Explainable Artificial Intelligent, this paper proposes a novel technique called Auto DeepVis to dissect catastrophic forgetting in continual learning. A new method to deal with catastrophic forgetting named critical freezing is also introduced upon investigating the dilemma by Auto DeepVis. Experiments on a captioning model meticulously present how catastrophic forgetting happens, particularly showing which components are forgetting or changing. The effectiveness of our technique is then assessed; and more precisely, critical freezing claims the best performance on both previous and coming tasks over baselines, proving the capability of the investigation. Our techniques could not only be supplementary to existing solutions for completely eradicating catastrophic forgetting for life-long learning but also explainable.
연구 동기 및 목표
- 지속적 학습 과정에서 깊이 신경망 내부에서 치명적인 忘却가 발생하는 메커니즘을 이해하는 것.
- 모델 또는 작업 수준이 아닌 구성 요소 수준(예: 필터, 블록)에서 忘却를 시각화하고 국소화할 수 있는 도구를 개발하는 것.
- 차차적 학습 과정에서 忘却에 가장 기여하는 가장 유연한 레이어를 특정하는 것.
- 가장 취약한 구성 요소만을 동결하는 타겟팅된 설명 가능한 해법인 핵심 동결 기법을 제안하는 것.
- 간단한 벤치마크를 피하고 복잡한 시각-언어 작업(이미지 캡션 생성)에서 Split MS-COCO를 사용하여 방법의 타당성을 검증하는 것.
제안 방법
- Auto DeepVis는 예측을 지지하거나 반박하는 픽셀을 식별함으로써 예측 변화를 시각화할 수 있도록 하는 예측 차이 분석(Prediction Difference Analysis, PDA)을 사용한다.
- 모델이 새로운 작업을 학습하기 전과 후의 활성화 맵 간의 교차율(Intersection over Union, IoU)을 계산하여 각 레이어에서의 忘却 정도를 정량화한다.
- 각 합성곱 블록에 대해 지표 세그멘테이션과 가장 높은 IoU를 가지는 필터를 대표 필터로 선정함으로써 계산 비용을 줄이면서도 해석 가능성을 유지한다.
- ResNet-50의 경우 5개의 잔차 블록을 분석하여 블록 3 및 4가 활성화 이탈에 가장 취약한 것으로 밝혀졌다.
- Auto DeepVis로 특정된 가장 유연한 레이어(예: 블록 3 및 4)만을 동결하는 타겟팅된 정규화 전략으로 핵심 동결 기법을 도입한다.
- 캡션 생성 및 忘却에 기여하는 정도를 평가하기 위해 디코더의 개별 구성 요소(LSTM, 임베딩, 선형층)를 각각 동결하여 분석한다.
실험 결과
연구 질문
- RQ1지속적 학습 과정에서 깊이 신경망의 어떤 특정 구성 요소(필터, 레이어, 블록)가 치명적인 忘却에 가장 기여하는가?
- RQ2모델 또는 작업 수준이 아닌 구성 요소 수준에서 忘却를 어떻게 시각화하고 정량화할 수 있는가?
- RQ3가장 유연한 레이어를 식별하고 선택적으로 동결하는 것이 이전 및 신규 작업 모두에서 더 나은 성능을 내는 데 기여하는가?
- RQ4LSTM, 선형층 등 다양한 디코더 구성 요소가 이미지 캡션 생성 모델의 忘却에 어떤 기여를 하는가?
- RQ5해석 가능한 AI 기법(예: 시각화)을 활용하면 지속적 학습 알고리즘 설계에 얼마나 기여할 수 있는가?
주요 결과
- ResNet-50의 블록 3 및 블록 4에서 가장 심각한 忘却가 발생하며, 활성화 맵 간 IoU가 이전 블록들보다 크게 감소한다.
- 블록 3에서 $M_{24}$와 $M_{19}$ 간 IoU가 급격히 감소하여 이곳이 치명적인 忘却의 주요 발생지로 확인된다.
- 핵심 동결—가장 유연한 레이어만을 동결하는 전략—이 이전 및 미래 작업 모두에서 가장 뛰어난 성능을 기록하며, 기존의 동결 전략을 능가한다.
- 정성적 분석 결과, 핵심 동결 후 예측 결과는 거의 동일하게 유지되며, 소수의 오분류(예: 미국 참새 vs. 기러기)만 발생한다. 이는 모두 새 종류에 속한다.
- 디코더의 LSTM 레이어를 동결할 경우 가장 높은 성능(_BLEU1: 46.1, CIDEr: 12.8_)을 기록하였고, 선형층을 동결할 경우 모든 지표가 급격히 하락(_BLEU1: 39.3, CIDEr: 4.2_)하였다.
- 유연한 레이어에 대해 지식 정착(Knowledge Distillation)을 적용한 결과, 시간이 지남에 따라 교사-학생 모델 간의 누적 오차로 인해 효과적이지 않았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.