Skip to main content
QUICK REVIEW

[논문 리뷰] Astroformer: More Data Might not be all you need for Classification

Rishit Dagli|arXiv (Cornell University)|2023. 04. 03.
Machine Learning and Data Classification인용 수 7
한 줄 요약

Astroformer는 하이브리드 트랜스포머-컨볼루션 아키텍처, 새로운 스택 설계, 상대적 자기주의 어텐션, 최적화된 데이터 증강 및 정규화를 통해 저데이터 환경에서 최신 기술 수준의 성능을 달성한다. Galaxy10 DECals 데이터셋에서 레이블이 부여된 이미지 17,736장만으로도 상위 1 정확도 94.86%를 기록하며, 이는 이전 방법보다 4.62% 높고, CIFAR-100과 Tiny ImageNet에서도 새로운 SOTA를 수립한다.

ABSTRACT

Recent advancements in areas such as natural language processing and computer vision rely on intricate and massive models that have been trained using vast amounts of unlabelled or partly labeled data and training or deploying these state-of-the-art methods to resource constraint environments has been a challenge. Galaxy morphologies are crucial to understanding the processes by which galaxies form and evolve. Efficient methods to classify galaxy morphologies are required to extract physical information from modern-day astronomy surveys. In this paper, we introduce Astroformer, a method to learn from less amount of data. We propose using a hybrid transformer-convolutional architecture drawing much inspiration from the success of CoAtNet and MaxViT. Concretely, we use the transformer-convolutional hybrid with a new stack design for the network, a different way of creating a relative self-attention layer, and pair it with a careful selection of data augmentation and regularization techniques. Our approach sets a new state-of-the-art on predicting galaxy morphologies from images on the Galaxy10 DECals dataset, a science objective, which consists of 17736 labeled images achieving 94.86% top-$1$ accuracy, beating the current state-of-the-art for this task by 4.62%. Furthermore, this approach also sets a new state-of-the-art on CIFAR-100 and Tiny ImageNet. We also find that models and training methods used for larger datasets would often not work very well in the low-data regime.

연구 동기 및 목표

  • 대규모 사전학습이 불가능한 저데이터 환경에서 고성능 모델을 훈련하는 데 도전한다.
  • 은하 형성과 진화를 이해하는 데 핵심적인 과제인 은하 형태 분류를 향상시킨다.
  • 합성 데이터나 전이 학습에 의존하지 않고도 제한된 레이블 데이터로도 잘 일반화되는 방법을 개발한다.
  • Galaxy10 DECals 데이터셋에서 은하 형태 분류의 새로운 최신 기술 수준을 확립한다.

제안 방법

  • CoAtNet과 MaxViT를 영감으로 삼은 하이브리드 트랜스포머-컨볼루션 아키텍처를 제안하며, 특징 학습을 향상시키기 위해 재설계된 스택 구조를 포함한다.
  • 장거리 의존성 모델링을 향상시키면서도 효율성을 유지하기 위해 수정된 상대적 자기주의 어텐션 메커니즘을 도입한다.
  • 강건성과 일반화 능력을 향상시키기 위해 지역적 드롭아웃 기반의 맞춤형 데이터 증강 전략을 활용한다.
  • 과적합을 방지하기 위해 가중치 감소와 학습률 스케줄링과 같은 철저한 정규화 기법을 적용한다.
  • 전이 학습 없이, 감독 학습 설정에서부터 모델을 훈련시으며, 샘플 효율적인 학습에 집중한다.
  • 데이터 효율성과 모델 일반화를 향상시키기 위해 RandAugment과 기타 증강 레이어의 조합을 사용한다.

실험 결과

연구 질문

  • RQ1사전학습 없이도 하이브리드 트랜스포머-컨볼루션 아키텍처가 저데이터 이미지 분류에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2스택 구조와 어텐션 메커니즘과 같은 아키텍처 설계 선택이 저데이터 환경에서 성능에 어떤 영향을 미치는가?
  • RQ3레이블이 부족한 상황에서 데이터 증강 및 정규화 기법이 일반화 능력을 얼마나 향상시키는가?
  • RQ4Galaxy10 DECals와 같은 작은 데이터셋에서부터 훈련된 모델이 동일한 환경에서 전이 학습된 모델보다 성능이 뛰어날 수 있는가?
  • RQ5저데이터 환경에서 비전 트랜스포머의 성능이 크게 떨어지며, 이는 아키텍처 및 훈련 수정을 통해 완화될 수 있는가?

주요 결과

  • Astroformer는 Galaxy10 DECals 데이터셋에서 상위 1 정확도 94.86%를 기록하며, 이는 이전 최신 기술 수준보다 4.62% 향상된 성능이다.
  • 가장 큰 Astroformer 버전을 사용해 CIFAR-100에서 상위 1 정확도 93.36%를 기록하며, 새로운 최신 기술 수준을 확립한다.
  • Tiny ImageNet에서는 상위 1 정확도 89.38%를 기록하며, 이 벤치마크에 대해 새로운 SOTA를 수립한다.
  • 저데이터 환경에서도 모델이 잘 일반화되며, 훈련 손실과 평가 정확도 사이의 격차가 작아 강력한 일반화 능력을 보인다.
  • 합성 데이터로 훈련하거나 표준 ViT 훈련 프로토콜을 사용한 모델은 저데이터 설정에서 성능이 열등하여, 전용 설계의 필요성을 강조한다.
  • 제거 실험 결과에 따르면, 부두 없이 옆으로 기울여진 은하와 교란된 은하가 오류의 주요 원인으로 나타나며, 이들 클래스는 더 분류하기 어려운 편임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.