Skip to main content
QUICK REVIEW

[논문 리뷰] On the Usefulness of Deep Ensemble Diversity for Out-of-Distribution Detection

Guoxuan Xia, Christos-Savvas Bouganis|arXiv (Cornell University)|2022. 07. 15.
Anomaly Detection Techniques and Applications인용 수 4
한 줄 요약

이 논문은 ImageNet 규모의 모델에서 상호정보량(MI)으로 측정된 딥 앙상블의 다양성이 분포 외부(OOD) 탐지 성능을 향상시킨다는 일반적인 믿음을 도전한다. 대신, 작업별 점수인 Energy와 같은 이진 OOD 탐지기들을 앙상블하여 평균화하는 것이 더 뛰어난 성능을 내며, 앙상블 내에서 Energy 점수의 평균이 최고의 OOD 벤치마크에서 FPR@95 4.48%의 최신 기술 성능을 달성한다.

ABSTRACT

The ability to detect Out-of-Distribution (OOD) data is important in safety-critical applications of deep learning. The aim is to separate In-Distribution (ID) data drawn from the training distribution from OOD data using a measure of uncertainty extracted from a deep neural network. Deep Ensembles are a well-established method of improving the quality of uncertainty estimates produced by deep neural networks, and have been shown to have superior OOD detection performance compared to single models. An existing intuition in the literature is that the diversity of Deep Ensemble predictions indicates distributional shift, and so measures of diversity such as Mutual Information (MI) should be used for OOD detection. We show experimentally that this intuition is not valid on ImageNet-scale OOD detection -- using MI leads to 30-40% worse %FPR@95 compared to single-model entropy on some OOD datasets. We suggest an alternative explanation for Deep Ensembles' better OOD detection performance -- OOD detection is binary classification and we are ensembling diverse classifiers. As such we show that practically, even better OOD detection performance can be achieved for Deep Ensembles by averaging task-specific detection scores such as Energy over the ensemble.

연구 동기 및 목표

  • 상호정보량(MI)으로 측정된 딥 앙상블 다양성이 ImageNet 규모의 모델에서 분포 외부(OOD) 입력을 신뢰성 있게 나타내는지 조사하기.
  • 높은 앙상블 다양성이 분포 이탈과 관련이 있으며, 따라서 OOD 탐지에 기여한다는 널리 퍼진 직관을 도전하기.
  • 단일 모델보다 딥 앙상블이 뛰어난 OOD 탐지 성능을 보이는 진정한 메커니즘을 규명하기.
  • Energy와 같은 더 나은 OOD 탐지 점수를 앙상블하여 표준 불확실성 지표를 초월해 성능 향상을 이룰 수 있는지 평가하기.

제안 방법

  • 저자는 ImageNet 규모의 OOD 탐지 벤치마크에서 여러 불확실성 지표—앙상블 엔트로피(Ens. H), 평균 엔트로피(Av. H), 상호정보량(MI), Energy—를 평가한다.
  • 표준 분해를 사용하여 MI를 계산한다: MI ≈ Ens. H - Av. H, 이를 앙상블 다양성의 척도로 해석한다.
  • 단일 모델과 딥 앙상블 간의 OOD 탐지 성능을 AUROC와 FPR@95를 통해 비교하며, 점수는 앙상블 구성원의 평균값을 사용한다.
  • 제닝슨 부등식(Jensen’s inequality)을 적용하여, 다양한 이진 OOD 분류기들을 앙상블하는 것이 성능 향상에 기여하는 이론적 근거를 제시한다.
  • 작업별 점수(예: Energy)를 앙상블에 걸쳐 평균화하는 방법을 제안하고 평가하며, 이는 다른 불확실성 지표보다 일관되게 뛰어난 성능을 보임을 보여준다.
  • 표준 평가 프로토콜을 따르며, ImageNet-R, TinyImageNet, ObjectNet 등 여러 OOD 데이터셋에서 광범위한 실험을 수행한다.

실험 결과

연구 질문

  • RQ1딥 앙상블 구성원 간의 상호정보량(MI)이 ImageNet 규모의 모델에서 분포 외부(OOD) 입력을 안정적으로 나타내는가?
  • RQ2딥 앙상블이 단일 모델보다 OOD 탐지에서 뛰어난 성능을 내는 이유는 앙상블 다양성 때문인가, 아니면 다른 메커니즘이기인가?
  • RQ3Energy와 같은 더 나은 OOD 탐지 점수를 앙상블하여, 표준 불확실성 지표를 초월해 성능 향상을 이룰 수 있는가?
  • RQ4딥 앙상블의 성능 향상 원인이 이진 분류 설정에서 다양한 오류 패tern을 앙상블 구성원 간 평균화함으로써 발생하는가?

주요 결과

  • 다양성 척도로 사용된 상호정보량(MI)은 단일 모델 엔트로피보다 유의미하게 열등하며, 일부 OOD 데이터셋에서 FPR@95 값이 30~40% 높게 나타난다.
  • 앙상블 엔트로피(Ens. H)와 평균 엔트로피(Av. H)는 항상 단일 모델 대비 우수한 성능을 보이며, 이는 앙상블이 불확실성 추정을 향상시킨다는 것을 시사한다.
  • 앙상블 내에서 Energy 점수를 평균화하면 가장 우수한 전체 OOD 탐지 성능을 달성하며, ObjectNet OOD 벤치마크에서 FPR@95 4.48%를 기록한다.
  • 최고 성능을 보인 평균 Energy 방법은 ObjectNet에서 AUROC 99.08%를 달성하여, 단일 모델의 Energy와 모든 다른 앙상블 기반 불확실성 지표를 모두 압도한다.
  • 본 연구는 앙상블 다양성(MI를 통한 측정)이 대규모 스케일에서 OOD 입력과 상관이 없다는 증거를 발견하지 못하였으며, 이는 문헌에서 널리 인용된 직관을 뒷받침하지 못한다.
  • 딥 앙상블의 뛰어난 성능은 다양성이 직접적인 OOD 지표로 작용하기보다는, 서로 다른 오류 패턴을 보이는 다양한 이진 OOD 탐지기를 앙상블하여 상호 보완하는 데 기인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.