[논문 리뷰] Negative Label Guided OOD Detection with Pretrained Vision-Language Models
이 논문은 대규모 코퍼스에서 유도된 광범위한 음성 레이블을 활용하여 시각-언어 모델에서 이상치 검출 성능을 향상시키는 새로운 후행적 OOD 검출 방법인 NegLabel을 제안한다. 학습된 점수를 통해 이미지가 내재된 분포(ID) 레이블과 음성 레이블에 대한 유사도를 측정함으로써, 여러 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 도메인 이동에 대해서도 뛰어난 강건성을 보인다. 특히 ImageNet-1k에서 94.21% AUROC와 25.40% FPR95를 기록하였다.
Out-of-distribution (OOD) detection aims at identifying samples from unknown classes, playing a crucial role in trustworthy models against errors on unexpected inputs. Extensive research has been dedicated to exploring OOD detection in the vision modality. Vision-language models (VLMs) can leverage both textual and visual information for various multi-modal applications, whereas few OOD detection methods take into account information from the text modality. In this paper, we propose a novel post hoc OOD detection method, called NegLabel, which takes a vast number of negative labels from extensive corpus databases. We design a novel scheme for the OOD score collaborated with negative labels. Theoretical analysis helps to understand the mechanism of negative labels. Extensive experiments demonstrate that our method NegLabel achieves state-of-the-art performance on various OOD detection benchmarks and generalizes well on multiple VLM architectures. Furthermore, our method NegLabel exhibits remarkable robustness against diverse domain shifts. The codes are available at https://github.com/tmlr-group/NegLabel.
연구 동기 및 목표
- 시각-언어 모델에서 텍스트 정보를 활용하는 효과적인 OOD 검출 방법의 부족을 해결하기 위해.
- 다양한 도메인 이동 상황에서도 일반화 능력과 강건성을 향상시키기 위해.
- 정교한 의미 거리의 음성 레이블을 포함시켜 검출 성능을 향상시키는 후행적 방법을 개발하기 위해.
- 내재된 분포와 음성 레이블에 대한 유사도 균형을 고려한 더 나은 OOD 분류 성능을 위한 점수 함수를 설계하기 위해.
제안 방법
- 내재된 분포(ID) 레이블과의 유사도는 양의 상관관계를 가지며, 음성 레이블과의 유사도는 음의 상관관계를 가지는 새로운 OOD 점수를 제안한다.
- 텍스트 임베딩 공간에서 코사인 거리 기반으로 ID 레이블과의 의미적 분리도가 높은 음성 레이블을 선택하기 위해 NegMining 알고리즘을 도입한다.
- 이미지 및 텍스트 인코더를 사용해 이미지-텍스트 유사도 점수를 계산하기 위해 동결된 시각-언어 모델을 활용한다.
- ID 레이블과 음성 레이블의 유사도에 대해 정규화하는 합-소프트맥스 기반 OOD 점수를 설계하여 분류 성능을 향상시킨다.
- 재학습 없이도 점수의 안정성과 분산 감소를 위해 추론 시 그룹화 전략을 적용한다.
- 프롬프트 엔지니어링과 고정된 텍스트 인코더를 활용해 일관되고 확장 가능한 임베딩 계산을 보장한다.
실험 결과
연구 질문
- RQ1많은 수의 음성 레이블을 활용하면 시각-언어 모델에서 OOD 검출 성능이 향상되는가?
- RQ2ID 레이블과 의미적으로 떨어진 음성 레이블은 내재된 분포와 이상치 샘플 간의 분리성 향상에 어떻게 기여하는가?
- RQ3제안된 NegLabel 방법은 다양한 시각-언어 모델 아키텍처와 벤치마크에 일반화되는가?
- RQ4기존의 OOD 검출 접근 방식과 비교해 다양한 도메인 이동 상황에서 이 방법은 얼마나 강건한가?
- RQ5음성 레이블이 OOD 검출에 효과적인 이론적 근거는 무엇인가?
주요 결과
- NegLabel는 대규모 ImageNet-1k OOD 검출 벤치마크에서 94.21% AUROC와 25.40% FPR95를 달성하며, 많은 완전 지도 학습 방법을 능가한다.
- CIFAR-10, CIFAR-100, Tiny-ImageNet 등 여러 OOD 검출 벤치마크에서 최신 기술 수준의 성능을 보였다.
- CLIP, ALIGN, GroupViT 등 다양한 시각-언어 모델 아키텍처에 대해 잘 일반화됨을 확인하였다.
- 분포 이동 상황에서도 매우 강건한 성능 유지를 보이며, 다양한 도메인 이동에 대해 높은 성능 유지를 유지하였다.
- 이론적 분석을 통해 대규모 음성 레이블 설정 하에서 OOD 점수가 정규 분포로 수렴함을 확인하였으며, 이는 통계적 안정성을 뒷받침한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.