Skip to main content
QUICK REVIEW

[논문 리뷰] OODformer: Out-Of-Distribution Detection Transformer

Rajat Koner, Poulami Sinhamahapatra|arXiv (Cornell University)|2021. 07. 19.
Adversarial Robustness in Machine Learning인용 수 14
한 줄 요약

OODformer는 전역적인 이미지 컨텍스트와 주목적 기반 특징 상관관계를 활용하여, 음성 샘플링 또는 OOD 데이터에 대한 미세조정 없이도, Vision Transformers (ViT)를 사용해 새로운 외부 분포(OOD) 탐지 방법을 제안한다. ViT의 [class] 토큰 임베딩의 클래스 조건부 유사도와 신뢰도 점수를 활용함으로써, CIFAR-10/-100 및 ImageNet30에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

A serious problem in image classification is that a trained model might perform well for input data that originates from the same distribution as the data available for model training, but performs much worse for out-of-distribution (OOD) samples. In real-world safety-critical applications, in particular, it is important to be aware if a new data point is OOD. To date, OOD detection is typically addressed using either confidence scores, auto-encoder based reconstruction, or by contrastive learning. However, the global image context has not yet been explored to discriminate the non-local objectness between in-distribution and OOD samples. This paper proposes a first-of-its-kind OOD detection architecture named OODformer that leverages the contextualization capabilities of the transformer. Incorporating the trans\-former as the principal feature extractor allows us to exploit the object concepts and their discriminate attributes along with their co-occurrence via visual attention. Using the contextualised embedding, we demonstrate OOD detection using both class-conditioned latent space similarity and a network confidence score. Our approach shows improved generalizability across various datasets. We have achieved a new state-of-the-art result on CIFAR-10/-100 and ImageNet30.

연구 동기 및 목표

  • 안전이 중요한 시각 응용 분야에서 모델 성능이 크게 떨어지는 외부 분포(OOD) 샘플 탐지라는 핵심 과제를 해결하기 위해.
  • Vision Transformers(ViT)가 전역적인 이미지 컨텍스트와 객체 속성 동시 발생을 포착하는 잠재력을 탐색하기 위해.
  • 음성 샘플링, 대비 손실, 또는 OOD 데이터에 대한 미세조정에 의존하지 않고 다양한 데이터셋 간에 일반화 가능한 방법을 개발하기 위해.
  • ViT의 자기 주목적 메커니즘이 OOD 탐지에 적합한 의미적으로 조밀한 표현을 내재적으로 학습한다는 것을 입증하기 위해.

제안 방법

  • 표준 교차 엔트로피 손실을 사용하여 감독 분류를 위한 ViT를 내부 분포(ID) 데이터에서 훈련한다.
  • 입력 이미지의 전역적이고 맥락화된 표현으로서 ViT의 최종 레이어에서 [class] 토큰 임베딩을 추출한다.
  • ID 임베딩과 각 클래스의 평균 임베딩 간의 클래스 조건부 거리 측도(예: 코사인, 마할라노비스, 유클리드)를 계산하여 OOD 탐지에 활용한다.
  • 분류 헤드에서의 소프트맥스 신뢰도 점수를 두 번째 OOD 탐지 신호로 사용한다.
  • 여러 벤치마크 데이터셋에서 AUROC와 같은 표준 지표를 사용해 OOD 탐지 성능을 평가한다.
  • 이미지 확대 여부에 관계없이, 랜덤 초기화 및 ImageNet 사전 훈련된 모델을 포함한 ResNet 기반 베이스라인과 ViT 기반 OODformer를 비교한다.

실험 결과

연구 질문

  • RQ1ViT는 대비 손실이나 음성 샘플링 없이도 외부 분포 샘플을 효과적으로 탐지할 수 있는가?
  • RQ2ViT의 전역적 컨텍스트와 다중 헤드 자기 주목적 메커니즘이 CNN보다 OOD 일반화 성능을 향상시키는가?
  • RQ3거리 측도 선택(코사인, 유클리드, 마할라노비스)이 ViT 임베딩 공간에서 OOD 탐지 성능에 미치는 영향은 어떠한가?
  • RQ4간단한 신뢰도 기반 및 임베딩 기반 OOD 탐지 방법이 기존 최신 기술 수준의 접근법을 초월할 수 있는가?

주요 결과

  • OODformer는 CIFAR-100에서 94.4의 새로운 최신 기술 수준 AUROC를 달성하여, 최고의 ResNet-101 기반 베이스라인(87.8 AUROC)을 크게 앞서 간다.
  • 경량 ViT 변종인 DeiT-Tiny-16는 더 큰 ResNet 모델들조차도 뛰어넘는 94.4 AUROC를 달성했으며, 그 크기와 파라미터 수가 더 적음에도 불구하고 성능을 냈다.
  • 사전 훈련된 ViT와 DeiT 변종은 이미지 확대 및 미세조정 후에도 ImageNet 사전 훈련된 ResNets보다 일관되게 뛰어난 성능을 보였으며, 이는 ViT의 인덕티브 바이어스가 OOD 탐지에 더 유리함을 시사한다.
  • 마할라노비스 거리 측도가 코사인 및 유클리드 거리보다 略적으로 더 뛰어난 성능을 보였는데, 이는 클래스 평균과 공분산 정보를 모두 활용하기 때문이다.
  • OODformer는 거리 측도 선택에 대해 뛰어난 안정성을 보였으며, 다양한 측도 간 성능 변동 폭이 ±2% 이내로 매우 작았다.
  • 모델 용량이 증가할수록 ViT와 ResNet 간의 성능 격차가 더욱 벌어지며, 이는 ViT의 주목적 메커니즘이 OOD 탐지에 적합한 구분력 있고 맥락 인식 가능한 표현을 더 잘 포착한다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.