Skip to main content
QUICK REVIEW

[논문 리뷰] Continual Learning with Foundation Models: An Empirical Study of Latent Replay

Оleksiy Ostapenko, Timothée Lesort|arXiv (Cornell University)|2022. 04. 30.
Domain Adaptation and Few-Shot Learning인용 수 9
한 줄 요약

이 논문은 잠재 공간에서 고정된 기초 모델을 특징 추출기로 사용하여 지속적 학습(Continual Learning, CL)을 조사하며, 원시 데이터에 대한 엔드 투 엔드 미세조정 대비 잠재 경험 재생(Experience Replay, ER)을 비교한다. 잠재 ER은 특히 사전 훈련된 모델이 분포 외 데이터로 잘 일반화할 경우에, 훨씬 낮은 계산 자원으로도 경쟁 가능한 정확도를 달성하며, 알고리즘 설계보다는 데이터 특성—예를 들어 작업 유사도와 표현 품질—이 CL 성능에 더 큰 영향을 미친다는 것을 입증한다.

ABSTRACT

Rapid development of large-scale pre-training has resulted in foundation models that can act as effective feature extractors on a variety of downstream tasks and domains. Motivated by this, we study the efficacy of pre-trained vision models as a foundation for downstream continual learning (CL) scenarios. Our goal is twofold. First, we want to understand the compute-accuracy trade-off between CL in the raw-data space and in the latent space of pre-trained encoders. Second, we investigate how the characteristics of the encoder, the pre-training algorithm and data, as well as of the resulting latent space affect CL performance. For this, we compare the efficacy of various pre-trained models in large-scale benchmarking scenarios with a vanilla replay setting applied in the latent and in the raw-data space. Notably, this study shows how transfer, forgetting, task similarity and learning are dependent on the input data characteristics and not necessarily on the CL algorithms. First, we show that under some circumstances reasonable CL performance can readily be achieved with a non-parametric classifier at negligible compute. We then show how models pre-trained on broader data result in better performance for various replay sizes. We explain this with representational similarity and transfer properties of these representations. Finally, we show the effectiveness of self-supervised pre-training for downstream domains that are out-of-distribution as compared to the pre-training domain. We point out and validate several research directions that can further increase the efficacy of latent CL including representation ensembling. The diverse set of datasets used in this study can serve as a compute-efficient playground for further CL research. The codebase is available under https://github.com/oleksost/latent_CL.

연구 동기 및 목표

  • 고정된 기초 모델을 사용한 잠재 경험 재생(Latent Experience Replay, ER)이 원시 데이터에 대한 엔드 투 엔드 미세조정 대비 지속적 학습(Continual Learning, CL)에서 얼마나 효과적인지 평가하기.
  • 기초 모델의 사전 훈련 데이터, 아키텍처, 알고리즘 설계가 잠재 공간에서의 후속 CL 성능에 어떻게 영향을 미치는지 조사하기.
  • CL 성능이 주로 CL 알고리즘 설계에 의해 결정되는지, 아니면 데이터 및 표현 특성에 의해 결정되는지 이해하기.
  • 표현 품질, 이식 가능성, 그리고 내부 분포 및 분포 외 데이터가 CL 성공에 미치는 역할 평가하기.
  • 표현 앙상블 등과 같은 실용적 구성 요소와 연구 방향을 식별하여 잠재 CL 성능을 추가로 향상시킬 수 있는 방법 모색하기.

제안 방법

  • 다양한 아키텍처, 사전 훈련 목표(예: 대비적 학습, 마스킹 오토인코더), 그리고 데이터셋을 포함한 26개의 사전 훈련된 비전 모델을 활용한 대규모 경험적 벤치마크를 구축한다.
  • 계산-정확도 트레이드오프를 비교하기 위해 원시 입력 공간(엔드 투 엔드 미세조정)과 잠재 공간(잠재 ER)에서 경험 재생(ER)을 적용한다.
  • 사전 훈련 도메인과의 유사도가 다양한 5개의 서로 다른 데이터 스트림을 사용하며, 내부 분포 및 분포 외(OOD) 설정을 포함한다.
  • 표준 평가 지표를 사용하여 CL 성능을 평가한다: 평균 정확도, 기억 상실 비율, 최종 작업의 정확도.
  • 성능 차이를 설명하기 위해 표현 특성(예: 표현 유사도, 이식 가능성)을 분석한다.
  • 최소한의 계산 자원으로 성능 향상을 달성할 수 있는지 테스트하기 위해 잠재 공간에서 비모수적 분류기(예: k-NN)를 사용한다.

실험 결과

연구 질문

  • RQ1다양한 데이터 스트림에서 고정된 기초 모델을 사용한 잠재 ER이 엔드 투 엔드 미세조정 대비 계산 비용과 정확도 측면에서 어떻게 비교되는가?
  • RQ2작업 유사도, 분포 이탈, 도메인 이탈 등 데이터 특성이 CL 성능에 미치는 영향은 어느 정도이며, CL 알고리즘과는 독립적으로 고려할 수 있는가?
  • RQ3기초 모델의 사전 훈련 데이터, 알고리즘, 아키텍처가 지속적 학습을 위한 잠재 표현의 품질에 어떻게 영향을 미치는가?
  • RQ4잠재 공간에서 비모수적 분류기(예: k-NN)가 거의 계산 자원 없이도 경쟁 가능한 CL 성능을 달성할 수 있는가?
  • RQ5표현 앙상블은 잠재 CL 성능 향상에 어떤 역할을 하는가? 어떤 설정에서 가장 효과적인가?

주요 결과

  • 고정된 기초 모델을 사용한 잠재 ER은 거의 두 개의 계산 주기(100배) 정도 낮은 계산 자원을 요구함에도 불구하고 대부분의 데이터 스트림에서 엔드 투 엔드 미세조정과 비교해 유사하거나 더 높은 최종 정확도를 달성한다.
  • 분포 외(OOD) 스트림에서는 엔드 투 엔드 미세조정이 잠재 ER을 크게 앞서며, 사전 훈련과의 분포 이탈이 심할 경우 미세조정이 필수적임을 시사한다.
  • 더 넓고 다양한 데이터로 사전 훈련된 기초 모델(예: DINO, CLIP, ImageNet-21k)은 우수한 잠재 표현을 제공하여 모든 재생 크기에서 더 나은 CL 성능을 이끌어낸다.
  • 잠재 특징의 표현 유사도와 이식 가능성은 CL 성공 여부를 강력하게 예측하는 요소이며, 이는 일부 모델이 다른 모델보다 더 잘 일반화하는 이유를 설명한다.
  • 잠재 공간에서 비모수적 분류기(예: k-NN)는 거의 계산 자원 없이도 뛰어난 성능을 달성하며, 파라미터 업데이트 없이도 기억 상실을 효과적으로 완화할 수 있음을 보여준다.
  • 자기지도 사전 훈련(예: DINO, CLIP)은 분포 외 도메인으로의 강력한 제로샷 일반화를 가능하게 하여, 이러한 설정에서 지도 사전 훈련보다 뛰어난 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.