Skip to main content
QUICK REVIEW

[논문 리뷰] Memory Efficient Continual Learning with Transformers

Beyza Ermiş, Giovanni Zappella|arXiv (Cornell University)|2022. 03. 09.
Domain Adaptation and Few-Shot Learning인용 수 12
한 줄 요약

이 논문은 사전 훈련된 트랜스포머를 위한 메모리 효율적인 지속적 학습 방법인 적응형 어댑터 정수화(ADA)를 제안한다. 이 방법은 어댑터 모듈과 지식 정수화를 활용하여 치명적인 잊음 현상을 방지한다. ADA는 고정된 파라미터 수를 유지하면서도 순차적 작업 간 높은 정확도를 유지하며, 추론 속도에서 최신 기술을 능가하고, AdapterFusion보다 최대 10배 적은 파라미터를 사용하면서도 텍스트 및 비전 작업에서 유사하거나 더 뛰어난 성능을 달성한다.

ABSTRACT

In many real-world scenarios, data to train machine learning models becomes available over time. Unfortunately, these models struggle to continually learn new concepts without forgetting what has been learnt in the past. This phenomenon is known as catastrophic forgetting and it is difficult to prevent due to practical constraints. For instance, the amount of data that can be stored or the computational resources that can be used might be limited. Moreover, applications increasingly rely on large pre-trained neural networks, such as pre-trained Transformers, since the resources or data might not be available in sufficiently large quantities to practitioners to train the model from scratch. In this paper, we devise a method to incrementally train a model on a sequence of tasks using pre-trained Transformers and extending them with Adapters. Different than the existing approaches, our method is able to scale to a large number of tasks without significant overhead and allows sharing information across tasks. On both image and text classification tasks, we empirically demonstrate that our method maintains a good predictive performance without retraining the model or increasing the number of model parameters over time. The resulting model is also significantly faster at inference time compared to Adapter-based state-of-the-art methods.

연구 동기 및 목표

  • 모델이 시간이 지남에 따라 새로운 작업을 학습하면서 이전 지식을 잊지 않는 지속적 학습 환경에서 치명적인 잊음 현상을 해결한다.
  • 제한된 메모리와 계산 자원을 가진 실생활 응용 분야에서 사전 훈련된 트랜스포머를 효율적이고 확장 가능한 방식으로 지속적 학습할 수 있도록 한다.
  • 모델 크기를 늘리거나 다시 처음부터 훈련하지 않고도 증가하는 수많은 작업 간 높은 예측 성능을 유지한다.
  • 기존 어댑터 기반 지속적 학습 방법 대비 추론 시간과 메모리 사용량을 줄인다.
  • 다양한 사전 훈련된 모델을 사용하여 텍스트 및 비전 분류 작업에서 제안된 방법의 효과성을 입증한다.

제안 방법

  • 어댑터 모듈과 지식 정수화를 결합하여 이전 작업의 지식을 유지하는 방법인 적응형 어댑터 정수화(ADA)를 도입한다.
  • 고정된 어댑터 모듈 풀을 사용하여 새로운 작업에 대해 동적으로 선택하고 미세조정함으로써 작업 수 증가에 따른 파라미터 증가를 방지한다.
  • 이전 작업 전용 어댑터에서 현재 어댑터로 지식을 전달하기 위해 정수화 손실을 활용하여 잊음 현상을 최소화한다.
  • 특징 수준과 출력 로짓 수준의 정수화에 기반한 두 가지 정수화 전략인 LEEP 및 TransRate를 적용하여 지식 전이를 향상시킨다.
  • 이중 및 다중 분류 시나리오 모두를 지속적 학습 환경에서 지원하며, 텍스트(Arxiv, Reuters) 및 비전(CIFAR100, MiniImageNet) 벤치마크에서 평가한다.
  • 어댑터 기반 미세조정을 비전 트랜스포머(DeiT, ViT)로 확장하여 다양한 모델 아키텍처 간 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1어댑터와 정수화 기반의 지속적 학습 방법이 파라미터 수를 늘리지 않고도 많은 수의 순차적 작업 간 높은 성능을 유지할 수 있는가?
  • RQ2ADA 방법이 기존 최신 기술 대비 메모리 효율성, 추론 속도, 정확도 측면에서 어떻게 비교되는가?
  • RQ3ADA에서의 지식 정수화가 텍스트 및 비전 지속적 학습 작업에서 치명적인 잊음 현상을 어느 정도 감소시키는가?
  • RQ4특히 소수의 예시가 있는 설정에서, ADA는 기존 방법과 비교해 앞서거나 유사한 전방 및 후방 전이 이점을 달성하는가?
  • RQ5ADA는 비전 트랜스포머에 효과적으로 적용될 수 있으며, 다양한 사전 훈련된 비전 모델 간 성능을 유지하는가?

주요 결과

  • Arxiv에서 100개의 레이블, Reuters에서 160개의 레이블만으로도 ADA는 독립형 어댑터와 유사한 예측 성능을 달성하며, 소수의 예시 설정에서 이를 초월한다.
  • Arxiv에서 200개의 레이블을 사용할 경우, ADA-K=4와 TransRate 조합은 독립형 어댑터와 동일한 성능을 내지만 훨씬 적은 파라미터를 사용한다.
  • AdapterFusion 대비 파라미터 수를 10배 줄였으며, 작업 수에 관계없이 파라미터 수가 일정하게 유지된다.
  • 고정된 크기의 어댑터 풀과 효율적인 정수화 덕분에 어댑터 기반 최신 기술 대비 추론 속도가 빠르게 향상된다.
  • DeiT-B를 사용한 비전 작업에서, ADA는 낮은 후방 및 전방 전이 오차를 기록했으며, BWT는 거의 0에 수렴하고 전방 전이가 양수를 기록하여 효과적인 지식 유지 및 전이를 보여준다.
  • 이 방법은 다양한 모델 간 일반화가 가능하다: DistilBERT, RoBERTa, ViT/DeiT에서도 유사한 성능 추세를 관찰하여 아키텍처 간 강건성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.