Skip to main content
QUICK REVIEW

[논문 리뷰] OCFormer: One-Class Transformer Network for Image Classification

Prerana Mukherjee, Chandan Kumar Roy|arXiv (Cornell University)|2022. 04. 25.
Retinal Imaging and Analysis인용 수 5
한 줄 요약

OCFormer는 잠재 공간에 영점 중심 가우시안 노이즈를 의사 음성 클래스로 삽입하여 표현 학습을 향상시키는 비전 트랜스포머 기반의 일종 분류 프레임워크를 제안한다. 이 방법은 CIFAR-10, CIFAR-100, Fashion-MNIST 및 CelebA 안경 데이터셋에서 기존의 CNN 기반 일종 분류기보다 최대 6.7% 높은 평균 AUC 성능을 달성한다.

ABSTRACT

We propose a novel deep learning framework based on Vision Transformers (ViT) for one-class classification. The core idea is to use zero-centered Gaussian noise as a pseudo-negative class for latent space representation and then train the network using the optimal loss function. In prior works, there have been tremendous efforts to learn a good representation using varieties of loss functions, which ensures both discriminative and compact properties. The proposed one-class Vision Transformer (OCFormer) is exhaustively experimented on CIFAR-10, CIFAR-100, Fashion-MNIST and CelebA eyeglasses datasets. Our method has shown significant improvements over competing CNN based one-class classifier approaches.

연구 동기 및 목표

  • 음성 샘플이 존재하지 않는 극도로 불균형하거나 기울어진 데이터셋에서 일종 분류의 과제를 해결한다.
  • 고차원 표현 데이터에서 전통적인 생성 및 판별 방법의 한계를 극복한다.
  • 비전 트랜스포머(ViT)의 표현 능력을 활용하여 일종 분류 성능을 향상시킨다.
  • 깊이 있는 일종 분류기에서 흔히 발생하는 초구면 붕괴 문제를 새로운 노이즈 보완 잠재 공간 전략을 통해 완화한다.
  • 비전 트랜스포머 기반 모델이 일종 분류에서 효과적인지, 이는 이전 연구에서 거의 탐색되지 않은 분야임을 입증한다.

제안 방법

  • 입력 이미지를 고차원 잠재 공간으로 인코딩하기 위해 사전 훈련된 비전 트랜스포머(ViT)를 특징 추출기로 사용한다.
  • 잠재 공간 표현에 영점 중심 가우시안 노이즈를 의사 음성 클래스로 삽입하여 이상치 데이터를 시뮬레이션한다.
  • 양성 샘플의 응집성과 의사 음성 노이즈로부터의 분리성을 장려하는 최적의 손실 함수를 사용해 분류기를 훈련한다.
  • 하류 분류기 헤드(MLP, SVM 또는 KDE)에 입력하기 전에 원본 잠재 특징과 삽입된 노이즈 벡터를 연결한다.
  • 더 큰 ViT 아키텍처로 인한 모델 용량 증가에도 불구하고 과적합을 방지하기 위해 표준 정규화 기법을 적용한다.
  • 배치 크기, 잠재 차원, 분류기 깊이의 영향을 분석하기 위해 아블레이션 스터디를 수행한다.

실험 결과

연구 질문

  • RQ1실제 음성 샘플에 의존하지 않고도 비전 트랜스포머가 일종 이미지 분류에 효과적으로 적용될 수 있는가?
  • RQ2의사 음성 클래스로 영점 중심 가우시안 노이즈를 삽입함으로써 일종 설정에서 표현 학습이 어떻게 향상되는가?
  • RQ3비전 트랜스포머 기반 일종 분류에 최적의 잠재 차원, 배치 크기, 분류기 깊이 조합은 무엇인가?
  • RQ4다양한 벤치마크에서 OCFormer은 최신 일종 분류기와 비교해 AUC 성능에서 어떤가?
  • RQ5비전 트랜스포머 기반 특징 추출이 일종 분류 과제에서 CNN 기반 대비 더 나은 일반화 성능을 보이는가?

주요 결과

  • OCFormer는 ViT-large를 사용하여 CIFAR-10, CIFAR-100, Fashion-MNIST 및 CelebA 안경 데이터셋에서 평균 AUC 96.58%를 기록했으며, 모든 베이스라인을 초월했다.
  • ViT-base를 사용하여 잠재 차원 D=1000로 설정한 경우 CIFAR-10에서 AUC-ROC 98.72%를 달성했으며, 대비 학습 및 PANDA 방법보다 뚜렷하게 뛰어났다.
  • 모든 실험에서 잠재 차원 D=1000이 D=4096보다 항상 우수했으며, 이는 고차원 노이즈 삽입이 성능을 떨어뜨릴 수 있음을 시사한다.
  • MLP 분류기의 깊이를 증가시킬수록 성능이 일시적으로 감소하다가 더 깊은 아키텍처에서 향상되어, 비단조적 최적화 과정임을 나타낸다.
  • Grad-CAM 시각화 결과는 주의 메커니즘이 목표 이상 징후(안경)에 집중하고 있음을 확인하여 모델의 해석 가능성과 관련성을 입증했다.
  • CIFAR-10 및 CIFAR-100에서 MLP 및 SVM 분류기 사용 시, 경쟁 방법 대비 평균 AUC에서 6.7%의 상대적 향상을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.