Skip to main content
QUICK REVIEW

[논문 리뷰] A Multi-Head Model for Continual Learning via Out-of-Distribution Replay

Gyuhak Kim, Zixuan Ke|arXiv (Cornell University)|2022. 08. 20.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

이 논문은 기존 작업 파rameter를 업데이트하지 않고 작업별 분류기들을 구축하기 위해 분포 외(OOD) 리플레이를 사용하는 다중 헤드 지속적 학습 모델인 MORE를 제안한다. 사전 훈련된 트랜스포머에 어댑터 모듈을 활용하고 중요한 가중치를 보호하기 위해 하드 어텐션을 적용함으로써, MORE는 지속적 학습에서 최신 기술 수준의 정확도를 달성하면서 자연스럽게 OOD 탐지 기능도 제공한다.

ABSTRACT

This paper studies class incremental learning (CIL) of continual learning (CL). Many approaches have been proposed to deal with catastrophic forgetting (CF) in CIL. Most methods incrementally construct a single classifier for all classes of all tasks in a single head network. To prevent CF, a popular approach is to memorize a small number of samples from previous tasks and replay them during training of the new task. However, this approach still suffers from serious CF as the parameters learned for previous tasks are updated or adjusted with only the limited number of saved samples in the memory. This paper proposes an entirely different approach that builds a separate classifier (head) for each task (called a multi-head model) using a transformer network, called MORE. Instead of using the saved samples in memory to update the network for previous tasks/classes in the existing approach, MORE leverages the saved samples to build a task specific classifier (adding a new classification head) without updating the network learned for previous tasks/classes. The model for the new task in MORE is trained to learn the classes of the task and also to detect samples that are not from the same data distribution (i.e., out-of-distribution (OOD)) of the task. This enables the classifier for the task to which the test instance belongs to produce a high score for the correct class and the classifiers of other tasks to produce low scores because the test instance is not from the data distributions of these classifiers. Experimental results show that MORE outperforms state-of-the-art baselines and is also naturally capable of performing OOD detection in the continual learning setting.

연구 동기 및 목표

  • 기존 작업 분류기의 파rameter 업데이트를 피함으로써 클래스 증가 학습(CIL)에서의 치명적 잊음 문제를 해결하고자 한다.
  • 이전 모델을 재학습하기 위해 리플레이에 의존하지 않고도 효과적인 지속적 학습을 가능하게 하고자 한다.
  • 지속적 학습 환경에서 정확한 분류와 강력한 OOD 탐지 기능을 동시에 수행할 수 있는 방법을 개발하고자 한다.
  • 사전 훈련된 트랜스포머에 어댑터 모듈을 활용하여 성능을 향상시키면서도 이전 작업의 지식을 유지하고자 한다.
  • 다중 헤드 모델이 OOD 인식 분류기를 갖추면 단일 헤드 리플레이 기반 베이스라인보다 우수한 성능을 낼 수 있음을 입증하고자 한다.

제안 방법

  • MORE는 사전 훈련된 트랜스포머 기반 모델을 사용하여 각 새로운 작업에 대해 작업별 분류 헤드를 별도로 구성한다.
  • 사전 훈련된 가중치를 수정하지 않고도 작업별 적응을 가능하게 하기 위해 각 트랜스포머 레이어에 학습 가능한 어댑터 모듈을 삽입한다.
  • 메모리 버퍼는 각 작업의 소량의 샘플을 저장하며, 이는 해당 작업의 새로운 분류기를 훈련하는 데 사용된다.
  • 분류기는 내재된 분포(IND) 샘플에 대해 높은 신뢰도를, 분포 외(OOD) 샘플에 대해 낮은 신뢰도를 부여하도록 훈련되어 OOD 탐지가 가능해진다.
  • 훈련 중 기존 작업의 중요한 파rameter가 업데이트되지 않도록 하드 어텐션(마스킹)을 적용한다.
  • 추론 시에는 활성화 점수가 가장 높은 헤드를 선택함으로써, 작업 ID가 필요 없이 분류가 가능해진다.

실험 결과

연구 질문

  • RQ1작업별 분류기를 갖춘 다중 헤드 모델이 단일 헤드 리플레이 기반 방법보다 치명적 잊음 문제를 더 효과적으로 완화할 수 있는가?
  • RQ2메모리 버퍼에 분포 외(OOD) 샘플을 활용할 경우 분류 정확도와 OOD 탐지 성능이 향상되는가?
  • RQ3하드 어텐션을 통해 이전 작업의 파rameter를 보호함으로써 지속적 학습에서 이전 지식의 유지가 향상되는가?
  • RQ4어댑터 모듈을 갖춘 사전 훈련된 트랜스포머가 클래스 증가 학습에서 뛰어난 성능을 내면서도 OOD 탐지 기능을 제공할 수 있는가?
  • RQ5제안된 방법은 평균 분류 정확도와 증가 학습 정확도 측면에서 최신 기술 수준의 베이스라인과 비교해 어떻게 성능을 내는가?

주요 결과

  • CIFAR10-5T에서 MORE는 평균 분류 정확도(ACA) 89.16%를 달성하여 최고의 베이스라인(iCaRL, 77.51%)을 능가했다.
  • CIFAR100-10T에서 MORE는 ACA 70.23%와 AIA 69.79%를 기록하여 iCaRL(ACA 59.83%, AIA 70.00%)과 다른 최신 기술 수준의 방법들을 능가했다.
  • Tiny-ImageNet-10T에서 MORE는 ACA 63.06%와 AIA 58.96%를 기록하여 HAT(ACA 52.33%, AIA 64.96%)를 크게 앞서갔다.
  • MORE는 강력한 OOD 탐지 능력을 보였으며, 내재된 분포 샘플에 대해 높은 점수, 분포 외 샘플에 대해 낮은 점수를 생성했다.
  • 모든 데이터셋에서 높은 성능를 유지했으며, 모든 실험에서 평균 ACA 57.80%와 AIA 69.32%를 기록했다.
  • 제거 실험 결과, 메모리 샘플에서의 OOD 훈련이 성능 향상에 필수적임을 확인했으며, 이 요소를 제거할 경우 정확도가 크게 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.