Skip to main content
QUICK REVIEW

[논문 리뷰] Masked Autoencoders are Efficient Class Incremental Learners

Jiang-Tian Zhai, Xialei Liu|arXiv (Cornell University)|2023. 08. 24.
Domain Adaptation and Few-Shot LearningComputer Science인용 수 3
한 줄 요약

이 논문은 효율적인 클래스 증분 학습(CIL)을 위한 새로운 양방향 마스킹 오토에인코더(MAE) 프레임워크를 제안한다. 마스킹된 패치 재구성 기반으로 예시(exemplar)를 더 효율적으로 저장하고 재생 품질을 향상시킨다. 두 개의 상보적인 MAE 브랜치에서 유도된 이미지 수준 및 임bedding 수준의 특징을 융합함으로써, CIFAR-100, ImageNet-Subset, ImageNet-Full에서 기존 최고 성능를 달성하며, 기억 상실을 줄이고 표현 안정성을 향상시킨다.

ABSTRACT

Class Incremental Learning (CIL) aims to sequentially learn new classes while avoiding catastrophic forgetting of previous knowledge. We propose to use Masked Autoencoders (MAEs) as efficient learners for CIL. MAEs were originally designed to learn useful representations through reconstructive unsupervised learning, and they can be easily integrated with a supervised loss for classification. Moreover, MAEs can reliably reconstruct original input images from randomly selected patches, which we use to store exemplars from past tasks more efficiently for CIL. We also propose a bilateral MAE framework to learn from image-level and embedding-level fusion, which produces better-quality reconstructed images and more stable representations. Our experiments confirm that our approach performs better than the state-of-the-art on CIFAR-100, ImageNet-Subset, and ImageNet-Full. The code is available at https://github.com/scok30/MAE-CIL .

연구 동기 및 목표

  • 마스킹 오토에인코더(MAE)의 재구성 능력을 활용하여 클래스 증분 학습(CIL)에서 치명적인 기억 상실 문제를 해결하고자 한다.
  • 이전 작업 이미지의 무작위 패치만 저장함으로써, 전체 이미지가 아닌 예시의 효율성을 향상시키고자 한다.
  • 이중 MAE 아키텍처를 통해 이미지 수준 및 임베딩 수준의 융합을 통해 재생 데이터 품질과 표현 안정성을 향상시키고자 한다.
  • 제한된 메모리 예산 하에서 표준 CIL 벤치마크에서 최고 성능을 달성하고자 한다.

제안 방법

  • 이전 작업 이미지의 무작위 패치를 재생 버퍼에 저장하여, 최소한의 메모리 오버헤드로도 압축된 예시 저장을 가능하게 한다.
  • 희소하고 무작위로 마스킹된 패치에서 전체 이미지를 재구성하기 위해 마스킹 오토에인코더를 사용함으로써 효과적인 자기지도 기반 표현 학습을 가능하게 한다.
  • 주 재구성과 고주파 세부 정보 학습을 위한 두 가지 병렬 브랜치를 갖춘 이중 MAE 프레임워크를 설계한다.
  • 두 브랜치의 특징을 임베딩 수준에서 융합하여 더 다양하고 안정적인 표현을 생성함으로써 일반화 능력을 향상시킨다.
  • MAE에 감독 분류 헤드를 통합하여 분류 정확도와 재구성 정밀도를 동시에 최적화한다.
  • 학습 중 마스킹된 입력 데이터를 적용하여 정규화 역할을 하여 모델의 강건성 향상과 예시 저장에 대한 과적합 방지를 유도한다.
Figure 1: Our proposed bilateral MAE for efficient CIL. The Replay Buffer contains random patches selected from past task images, which is more efficient than storing whole images. Combining these with masked input data from the current task, the MAE simultaneously learns to classify and reconstruct
Figure 1: Our proposed bilateral MAE for efficient CIL. The Replay Buffer contains random patches selected from past task images, which is more efficient than storing whole images. Combining these with masked input data from the current task, the MAE simultaneously learns to classify and reconstruct

실험 결과

연구 질문

  • RQ1패치 기반 재구성 기반으로 예시 저장을 위한 효율적 학습 도구로 마스킹 오토에인코더를 효과적으로 재사용할 수 있는가?
  • RQ2이중 MAE 아키텍처에서 이미지 수준 및 임베딩 수준 융합이 기존 MAE와 비교해 재구성 품질과 표현 안정성에 어떻게 기여하는가?
  • RQ3유사한 메모리 제약 조건 하에서 제안된 방법이 기존 최고 수준의 재생 기반 CIL 접근법을 초월하는가?
  • RQ4패치 수준의 예시 사용이 성능을 유지하거나 향상시키면서 얼마나 많은 메모리 사용을 줄일 수 있는가?
  • RQ5특징 공간의 밀도 지표로 측정했을 때, 데이터 분포 변화 상황에서 모델의 일반화 능력은 어떠한가?

주요 결과

  • 제안된 이중 MAE 프레임워크는 10개의 작업을 거친 CIFAR-100에서 평균 정확도 79.12%를 달성하여 동일한 메모리 예산 하에서 이전 최고 성능 기준(CIM)보다 3.82% 높은 성능을 보였다.
  • 클래스당 80개의 예시 패치만 저장함으로써, CIFAR-100의 마지막 작업에서 상위-1 정확도 68.40%를 달성하여 DyTox(62.10%) 및 기타 메모리 효율적인 베이스라인을 크게 앞섰다.
  • 제안된 방법은 특징 공간 밀도 지표(π)가 상당히 높게 나타나, 데이터 이동 상황에서도 더 일반화 가능하고 강건한 표현을 제공함을 시사한다.
  • 세부 정보 브랜치 덕분에 재구성 품질이 크게 향상되었으며, 주 브랜치에서 누락된 고주파 텍스처를 포착함으로써 더 현실적이고 다양한 재생 데이터를 생성한다.
  • 모델은 모든 작업에서 높은 성능를 유지하며, CIFAR-100에서 기억 상실률(F↓ = 12.17)이 낮아, 효과적인 안정성-유연성 균형을 확보함을 보였다.
  • 절단 실험 결과, 성능 향상 요인이 오직 예시 수 증가 때문이 아니라, 이중 융합 및 패치 기반 재구성의 아키텍처 혁신에서 기인함을 확인하였다.
Figure 2: Overall framework of our bilateral MAE for CIL. The masked input is passed through two branches with embedding-level fusion for classification and image-level fusion for reconstruction. Full images can be generated from a small sample of input patches and the reconstructed images can be us
Figure 2: Overall framework of our bilateral MAE for CIL. The masked input is passed through two branches with embedding-level fusion for classification and image-level fusion for reconstruction. Full images can be generated from a small sample of input patches and the reconstructed images can be us

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.