Skip to main content
QUICK REVIEW

[논문 리뷰] A Variational Dirichlet Framework for Out-of-Distribution Detection

Wenhu Chen, Yilin Shen|arXiv (Cornell University)|2018. 11. 18.
Adversarial Robustness in Machine Learning참고 문헌 44인용 수 14
한 줄 요약

이 논문은 K차원 단형상에서의 레이블별 불확실성을 높은 차수의 분포로 모델링하는 변분 딜리클레 프레임워크를 제안한다. 이는 딜리클레 분포된 분류 확률의 진짜 사후분포를 근사하기 위해 변분 추론을 사용한다. 학습된 사후분포의 엔트로피는 강건한 불확실성 측도로 기존 방법보다 성능이 뛰어나며, 특히 적대적 분류 훈련을 추가했을 때 두드러진 성능 향상을 보인다.

ABSTRACT

With the recently rapid development in deep learning, deep neural networks have been widely adopted in many real-life applications. However, deep neural networks are also known to have very little control over its uncertainty for unseen examples, which potentially causes very harmful and annoying consequences in practical scenarios. In this paper, we are particularly interested in designing a higher-order uncertainty metric for deep neural networks and investigate its effectiveness under the out-of-distribution detection task proposed by~\cite{hendrycks2016baseline}. Our method first assumes there exists an underlying higher-order distribution $\mathbb{P}(z)$, which controls label-wise categorical distribution $\mathbb{P}(y)$ over classes on the K-dimension simplex, and then approximate such higher-order distribution via parameterized posterior function $p_θ(z|x)$ under variational inference framework, finally we use the entropy of learned posterior distribution $p_θ(z|x)$ as uncertainty measure to detect out-of-distribution examples. Further, we propose an auxiliary objective function to discriminate against synthesized adversarial examples to further increase the robustness of the proposed uncertainty measure. Through comprehensive experiments on various datasets, our proposed framework is demonstrated to consistently outperform competing algorithms.

연구 동기 및 목표

  • 기존 이상치 탐지 방법의 한계를 해결하기 위해, 고유한 불확실성과 경험적 불확실성을 혼동하는 문제를 해결한다.
  • 데이터 노이즈로 인한 불확실성과 분포 이탈로 인한 불확실성 간을 구분할 수 있는 높은 차수의 불확실성 측도를 개발한다.
  • 클래스 확률의 기본 분포를 딜리클레 분포로 모델링하여 높은 차수의 불확실성을 포착한다.
  • 적대적 예제에 대비한 보조 분류 목적함수를 통합하여 불확실성 추정의 강건성을 향상시킨다.
  • 변분 추론과 적대적 손실을 통합한 통일된 훈련 목표를 사용하여 다양한 아키텍처와 데이터셋에서 일반화 성능을 입증한다.

제안 방법

  • 레이블별 범주형 분포를 K차원 단형상 S_K 위에서 정의된 높은 차수의 분포 P(z)에 따라 추출된 K차원 랜덤 변수 z로 모델링한다.
  • 신경망을 사용하여 변분 추론을 통해 진짜 사후분포 p(z|y)를 근사하는 딜리클레 사후분포 p_θ(z|x)를 매개변수화한다.
  • 변분 사후분포의 엔트로피 H(p_θ(z|x))를 불확실성으로 정의하여 예측의 경험적 불확실성을 측정한다.
  • FGSM로 생성된 적대적 예제와 내재 데이터를 구분하기 위해 보조 분류 목적함수를 도입한다.
  • 변분 하한과 분류 목적함수를 통합하여 엔드 투 엔드 최적화를 위한 통합 훈련 목표를 구성한다.
  • 딜리클레 사후분포의 엔트로피를 닫힌 형태로 계산하여 몬테카를로 샘플링 없이도 효율적이고 확장 가능한 불확실성 추정이 가능하도록 한다.

실험 결과

연구 질문

  • RQ1레이블 분포를 높은 차수의 딜리클레 분포로 모델링함으로써 경험적 불확실성과 고유한 불확실성을 분리함으로써 이상치 탐지 성능을 향상시킬 수 있는가?
  • RQ2변분 딜리클레 사후분포의 엔트로피가 소프트맥스 신뢰도나 기타 불확실성 점수보다 더 신뢰할 수 있는 불확실성 측도를 제공하는가?
  • RQ3제안된 보조 분류 목적함수가 이상치 탐지 중 적대적 변형에 대한 강건성을 향상시키는 데 얼마나 효과적인가?
  • RQ4이 프레임워크는 다양한 네트워크 아키텍처와 데이터셋, 특히 CIFAR100과 같은 도전적인 데이터셋에서도 일반화 가능한가?
  • RQ5사전 분포 설정과 균형 조정 하이퍼파rameter의 영향은 최종 탐지 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 변분 딜리클레 프레임워크는 CIFAR10과 CIFAR100을 포함한 다양한 이상치 탐지 벤치마크에서 기존 방법보다 일관되게 뛰어난 성능을 보였다.
  • 균일한 사전분포가 아닌 정보가 담긴 비균일 사전분포를 사용할 경우, 진짜 레이블 정보를 유지함으로써 더 높은 탐지 정확도를 달성했다.
  • 적대적 분류 목적함수의 통합은 모든 아키텍처와 데이터셋에서 탐지 성능을 크게 향상시켰으며, 특히 CIFAR100에서 더 두드러진 성능 향상이 관찰되었다.
  • 변분 목표함수와 분류 목적함수 간의 균형 인자 값 0.1이 최적의 성능을 내는 것으로 나타났으며, 너무 작거나 너무 큰 값은 성능 저하를 초래했다.
  • 이 방법은 최신 기준인 AUROC 점수를 달성하여 내재 데이터와 이상치 데이터를 효과적으로 분리하는 것으로 입증되었다.
  • 딜리클레 엔트로피의 닫힌 형태 계산 덕분에 몬테카를로 샘플링 없이도 효율적인 불확실성 추정이 가능했으며, 이는 베이지안 신경망과는 대비된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.