[논문 리뷰] No True State-of-the-Art? OOD Detection Methods are Inconsistent across Datasets
이 논문은 표준화된 훈련 및 평가 조건 하에서 다양한 (내분포, 외분포) 데이터셋 쌍 간에 어떤 하나의 외분포(OOD) 검출 방법도 항상 다른 방법보다 뛰어나지 않음을 보여준다. 이는 비용이 많이 드는 공분산 추정을 피함으로써 저자료 환경에서 Mahalanobis 및 MSP보다 성능을 향상시키는 시아모닉 네트워크 기반의 방법인 쌍별 OOD 검출(POD)을 제안한다. 이는 더 체계적인 OOD 검출 벤치마크가 필요하다는 점을 강조한다.
Out-of-distribution detection is an important component of reliable ML systems. Prior literature has proposed various methods (e.g., MSP (Hendrycks & Gimpel, 2017), ODIN (Liang et al., 2018), Mahalanobis (Lee et al., 2018)), claiming they are state-of-the-art by showing they outperform previous methods on a selected set of in-distribution (ID) and out-of-distribution (OOD) datasets. In this work, we show that none of these methods are inherently better at OOD detection than others on a standardized set of 16 (ID, OOD) pairs. We give possible explanations for these inconsistencies with simple toy datasets where whether one method outperforms another depends on the structure of the ID and OOD datasets in question. Finally, we show that a method outperforming another on a certain (ID, OOD) pair may not do so in a low-data regime. In the low-data regime, we propose a distance-based method, Pairwise OOD detection (POD), which is based on Siamese networks and improves over Mahalanobis by sidestepping the expensive covariance estimation step. Our results suggest that the OOD detection problem may be too broad, and we should consider more specific structures for leverage.
연구 동기 및 목표
- 표준화된 16개의 (ID, OOD) 데이터셋 쌍 세트에서 최신 OOD 검출 방법들의 일관성을 평가하기 위해.
- 메서드가 표준화되어 있음에도 불구하고 다양한 데이터셋 조합 간에 OOD 검출 성능가 편차가 크다는 이유를 탐구하기 위해.
- 특히 저자료 환경에서의 성능에 영향을 미치는 내분포 훈련 데이터 크기의 영향을 탐색하기 위해.
- 고차원 공분산 행렬 추정을 피하는 방식으로 저자료 환경에서 성능을 향상시키는 새로운 방법인 쌍별 OOD 검출(POD)을 제안하기 위해.
- OOD 검출 문제 자체가 너무 광범위하며, 향후 연구는 신뢰할 수 있는 평가 및 개발을 위해 더 구체적이고 체계적인 설정을 고려해야 한다는 주장을 펼치기 위해.
제안 방법
- 16개의 (ID, OOD) 데이터셋 쌍에서 MSP, ODIN, Mahalanobis라는 세 가지 기존 OOD 검출 방법을 표준화된 훈련 및 평가를 통해 수행하였으며, 내분포 훈련 세트를 전부와 10%로 제한하여 평가하였다.
- 예측 점수 기반(예: MSP) 및 거리 기반(예: Mahalanobis) 방법 간 상대적 성능이 내분포 및 외분포 분포의 구조에 따라 어떻게 달라지는지 보여주기 위해 단순한 2차원 토이 데이터셋 두 개를 설계하였다.
- 고차원 공분산 행렬 추정을 피하는 방식으로 입력 샘플을 직접 비교하도록 학습하는 시아모닉 아키텍처 기반의 새로운 방법인 쌍별 OOD 검출(POD)을 도입하였다.
- POD는 시아모닉 아키텍처를 사용하여 내분포와 외분포 샘플을 구분할 수 있는 쌍별 유사도 함수를 학습함으로써 효율적인 추론과 저자료 환경에서의 높은 안정성을 확보한다.
- 훈련 또는 하이퍼파라미터 튜닝 시 외분포 데이터를 사용하지 않은 경우와 사용한 경우의 두 가지 설정에서 메서드를 평가하여 데이터 가용성에 대한 민감도를 분석하였다.
- 주요 평가 지표로는 AUROC와 FNR@95를 사용하였으며, 안정성을 확보하기 위해 세 개의 랜덤 시드 기반 평균을 취하였다.
실험 결과
연구 질문
- RQ1표준화된 조건 하에서 다양한 (ID, OOD) 데이터셋 쌍 간에 항상 다른 모든 방법보다 뛰어난 성능을 보이는 단일 OOD 검출 방법이 존재하는가?
- RQ2MSP, ODIN, Mahalanobis의 상대적 성능은 내분포 및 외분포 데이터셋의 특정 구조에 따라 어떻게 달라지는가?
- RQ3내분포 훈련 세트 크기를 10%로 줄였을 때, OOD 검출 방법의 성능 순위가 유지되는가?
- RQ4공분산 추정과 같은 계산 비용이 많이 드는 단계를 피하는 방식으로 저자료 환경에서 성능을 향상시킬 수 있는 새로운 방법을 설계할 수 있는가?
- RQ5내분포 분류 정확도와 OOD 검출 성능 간의 상관관계는 어느 정도인가?
주요 결과
- 모든 16개의 (ID, OOD) 데이터셋 쌍 간에 어떤 OOD 검출 방법도 항상 다른 방법보다 뛰어나지 않는다: 각 방법에 대해 다른 쌍에서 성능이 더 좋은 방법이 최소 3개 이상, 최대 13개까지 존재한다.
- 전체 데이터 환경에서는 Mahalanobis가 16개 쌍 중 12개에서 ODIN을 앞서지만, 저자료 환경(10% 훈련 데이터)에서는 이 비율이 단 3개로 떨어지며, 데이터 부족 상황에서 성능 역전이 발생함을 보여준다.
- 저자료 환경에서 POD는 MSP보다 13개의 (ID, OOD) 쌍에서, Mahalanobis보다 10개의 쌍에서 뛰어난 성능을 보이며, 자료가 부족한 환경에서의 효과성을 입증한다.
- 2차원 토이 예제를 통해 예측 점수 기반(예: MSP) 및 거리 기반(예: Mahalanobis) 방법의 상대적 성능은 데이터 분포의 구조에 따라 본질적으로 달라지며, 한 방법은 완벽할 수 있지만 다른 방법은 실패할 수 있음을 보여준다.
- 내분포 분류 정확도와 OOD 검출 AUROC 간 상관관계가 없다: 훈련 에포크를 늘일수록 내분포 정확도는 향상되었지만, 200 에포크 이후로는 OOD AUROC가 감소했으며, OOD 성능의 변동성이 커졌다.
- 외분포 데이터를 하이퍼파라미터 튜닝에 활용할 수 있는 경우에도, 저자료 환경에서 메서드 순위가 뒤바뀌며, 예를 들어 ODIN은 저자료 환경에서 16개 쌍 중 10개에서 Mahalanobis를 앞서지만, 전체 데이터에서는 이 비율이 5개로 줄어들며, 방법 선택의 불안정성을 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.