[논문 리뷰] OODformer: Out-Of-Distribution Detection Transformer
OODformer는 전역적인 이미지 컨텍스트와 주목적 기반 특징 상관관계를 활용하여, 음성 샘플링 또는 OOD 데이터에 대한 미세조정 없이도, Vision Transformers (ViT)를 사용해 새로운 외부 분포(OOD) 탐지 방법을 제안한다. ViT의 [class] 토큰 임베딩의 클래스 조건부 유사도와 신뢰도 점수를 활용함으로써, CIFAR-10/-100 및 ImageNet30에서 최신 기술 수준(SOTA) 성능을 달성한다.
A serious problem in image classification is that a trained model might perform well for input data that originates from the same distribution as the data available for model training, but performs much worse for out-of-distribution (OOD) samples. In real-world safety-critical applications, in particular, it is important to be aware if a new data point is OOD. To date, OOD detection is typically addressed using either confidence scores, auto-encoder based reconstruction, or by contrastive learning. However, the global image context has not yet been explored to discriminate the non-local objectness between in-distribution and OOD samples. This paper proposes a first-of-its-kind OOD detection architecture named OODformer that leverages the contextualization capabilities of the transformer. Incorporating the trans\-former as the principal feature extractor allows us to exploit the object concepts and their discriminate attributes along with their co-occurrence via visual attention. Using the contextualised embedding, we demonstrate OOD detection using both class-conditioned latent space similarity and a network confidence score. Our approach shows improved generalizability across various datasets. We have achieved a new state-of-the-art result on CIFAR-10/-100 and ImageNet30.
연구 동기 및 목표
- 안전이 중요한 시각 응용 분야에서 모델 성능이 크게 떨어지는 외부 분포(OOD) 샘플 탐지라는 핵심 과제를 해결하기 위해.
- Vision Transformers(ViT)가 전역적인 이미지 컨텍스트와 객체 속성 동시 발생을 포착하는 잠재력을 탐색하기 위해.
- 음성 샘플링, 대비 손실, 또는 OOD 데이터에 대한 미세조정에 의존하지 않고 다양한 데이터셋 간에 일반화 가능한 방법을 개발하기 위해.
- ViT의 자기 주목적 메커니즘이 OOD 탐지에 적합한 의미적으로 조밀한 표현을 내재적으로 학습한다는 것을 입증하기 위해.
제안 방법
- 표준 교차 엔트로피 손실을 사용하여 감독 분류를 위한 ViT를 내부 분포(ID) 데이터에서 훈련한다.
- 입력 이미지의 전역적이고 맥락화된 표현으로서 ViT의 최종 레이어에서 [class] 토큰 임베딩을 추출한다.
- ID 임베딩과 각 클래스의 평균 임베딩 간의 클래스 조건부 거리 측도(예: 코사인, 마할라노비스, 유클리드)를 계산하여 OOD 탐지에 활용한다.
- 분류 헤드에서의 소프트맥스 신뢰도 점수를 두 번째 OOD 탐지 신호로 사용한다.
- 여러 벤치마크 데이터셋에서 AUROC와 같은 표준 지표를 사용해 OOD 탐지 성능을 평가한다.
- 이미지 확대 여부에 관계없이, 랜덤 초기화 및 ImageNet 사전 훈련된 모델을 포함한 ResNet 기반 베이스라인과 ViT 기반 OODformer를 비교한다.
실험 결과
연구 질문
- RQ1ViT는 대비 손실이나 음성 샘플링 없이도 외부 분포 샘플을 효과적으로 탐지할 수 있는가?
- RQ2ViT의 전역적 컨텍스트와 다중 헤드 자기 주목적 메커니즘이 CNN보다 OOD 일반화 성능을 향상시키는가?
- RQ3거리 측도 선택(코사인, 유클리드, 마할라노비스)이 ViT 임베딩 공간에서 OOD 탐지 성능에 미치는 영향은 어떠한가?
- RQ4간단한 신뢰도 기반 및 임베딩 기반 OOD 탐지 방법이 기존 최신 기술 수준의 접근법을 초월할 수 있는가?
주요 결과
- OODformer는 CIFAR-100에서 94.4의 새로운 최신 기술 수준 AUROC를 달성하여, 최고의 ResNet-101 기반 베이스라인(87.8 AUROC)을 크게 앞서 간다.
- 경량 ViT 변종인 DeiT-Tiny-16는 더 큰 ResNet 모델들조차도 뛰어넘는 94.4 AUROC를 달성했으며, 그 크기와 파라미터 수가 더 적음에도 불구하고 성능을 냈다.
- 사전 훈련된 ViT와 DeiT 변종은 이미지 확대 및 미세조정 후에도 ImageNet 사전 훈련된 ResNets보다 일관되게 뛰어난 성능을 보였으며, 이는 ViT의 인덕티브 바이어스가 OOD 탐지에 더 유리함을 시사한다.
- 마할라노비스 거리 측도가 코사인 및 유클리드 거리보다 略적으로 더 뛰어난 성능을 보였는데, 이는 클래스 평균과 공분산 정보를 모두 활용하기 때문이다.
- OODformer는 거리 측도 선택에 대해 뛰어난 안정성을 보였으며, 다양한 측도 간 성능 변동 폭이 ±2% 이내로 매우 작았다.
- 모델 용량이 증가할수록 ViT와 ResNet 간의 성능 격차가 더욱 벌어지며, 이는 ViT의 주목적 메커니즘이 OOD 탐지에 적합한 구분력 있고 맥락 인식 가능한 표현을 더 잘 포착한다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.