Skip to main content
QUICK REVIEW

[논문 리뷰] Towards neural networks that provably know when they don't know

Alexander Meinke, Matthias Hein|arXiv (Cornell University)|2019. 09. 26.
Adversarial Robustness in Machine Learning참고 문헌 19인용 수 9
한 줄 요약

이 논문은 ReLU 신경망을 수정하여 훈련 데이터에서 멀리 떨어진 곳에서 예측 신뢰도가 낮은 결과를 수학적으로 보증하는 Certified Certain Uncertainty (CCU)를 제안한다. 이 방법은 생성 전처리로 가우시안 믹스처 모델(GMM)을 사용한다. CCU는 분포 외 데이터의 전체 이웃 영역에 대해 낮은 신뢰도 예측에 대한 수학적 증거를 제공하는 최초의 방법이며, worst-case OOD 탐지에서 최신 기술을 능가하면서도 내분포 정확도와 OOD 성능 유지를 유지한다.

ABSTRACT

It has recently been shown that ReLU networks produce arbitrarily over-confident predictions far away from the training data. Thus, ReLU networks do not know when they don't know. However, this is a highly important property in safety critical applications. In the context of out-of-distribution detection (OOD) there have been a number of proposals to mitigate this problem but none of them are able to make any mathematical guarantees. In this paper we propose a new approach to OOD which overcomes both problems. Our approach can be used with ReLU networks and provides provably low confidence predictions far away from the training data as well as the first certificates for low confidence predictions in a neighborhood of an out-distribution point. In the experiments we show that state-of-the-art methods fail in this worst-case setting whereas our model can guarantee its performance while retaining state-of-the-art OOD performance.

연구 동기 및 목표

  • 안전이 중요한 애플리케이션에서 신뢰도를 떨어뜨리는, 훈련 데이터에서 멀리 떨어진 곳에서 ReLU 네트워크가 임의로 높은 신뢰도 예측을 내는 문제를 해결하기 위해.
  • 고립된 점이 아니라 분포 외 입력의 전체 이웃 영역에 대해 낮은 신뢰도 예측에 대한 수학적 증거를 제공하는 방법을 개발하기 위해.
  • 정확도를 희생시키지 않고 내분포 분류와 분포 외 탐지에서 최신 기술 수준의 성능을 유지하기 위해.
  • 기존 OOD 탐지 방법의 한계를 극복하기 위해, 이는 강력한 보장이 없고 worst-case 적대적 편향에 의해 속일 수 있기 때문이다.
  • 베이지안 프레임워크와 생성 모델링(Gaussian mixture models)을 통합하여 깊은 네트워크에서 인증 가능한 불확실성 추정을 가능하게 하기 위해.

제안 방법

  • 이 방법은 내분포 및 분포 외 데이터를 별도로 모델링하는 베이지안 프레임워크를 사용하며, 분포 외 데이터는 가우시안 믹스처 모델(GMM)로 모델링된다.
  • 훈련 과정은 최대우도추정 문제로 설정되어 있으며, 내분포 정확도와 인증 가능한 OOD 불확실성 둘 다 직접 최적화한다.
  • GMM 기반의 밀도 추정기는 임의의 분포 외 점 주변의 전체 이웃 영역에서 예측 신뢰도의 수학적 상한을 계산할 수 있도록 한다.
  • 이 방법은 GMM을 신경망 아키텍처에 통합하여, 인증 가능한 불확실성 측정을 지원하는 공동 표현을 학습할 수 있도록 한다.
  • 구간 분석과 ReLU 네트워크의 리프시츠 성질을 사용하여 신뢰도 상한을 유도함으로써, 입력 공간에서의 소규모 편향에 대해 강건함을 보장한다.
  • 이 방법은 표준 ReLU 네트워크와 호환되며, GMM 전처리를 통합하는 것 외에는 아키텍처 변경이 필요하지 않다.

실험 결과

연구 질문

  • RQ1ReLU 기반 신경망을 수정하여 훈련 분포에서 멀리 떨어진 곳에서 수학적으로 낮은 신뢰도 예측을 보장할 수 있는가?
  • RQ2고립된 점이 아니라 분포 외 점의 전체 이웃 영역에서 신뢰도가 낮게 유지됨을 수학적으로 증명할 수 있는가?
  • RQ3기존 최신 기술 기반 OOD 탐지 방법들은 분포 외 입력의 이웃 영역에서 worst-case 적대적 편향에 실패하는가?
  • RQ4높은 내분포 정확도와 강력한 OOD 탐지 성능를 동시에 확보하면서도 공식적인 보장을 제공할 수 있는가?
  • RQ5기본적인 딥 네트워크에 생성 모델링을 통합하여 인증 가능한 불확실성 추정을 가능하게 할 수 있는가?

주요 결과

  • CCU는 CIFAR-10, CIFAR-100, SVHN, ImageNet 등 평가된 모든 데이터셋에서 최신 기술 수준의 내분포 정확도를 달성했으며, 기준 모델과 비교해 유사하거나 더 뛰어난 성능을 보였다.
  • OOD 탐지 성능에서는 CCU와 ODIN-ensemble(OE)가 가장 높은 AUC 스코어를 기록했으며, CCU는 모든 데이터셋에서 다른 방법들을 능가했고, 균일한 노이즈를 OOD로 사용한 CIFAR-10에서는 97.8% AUC를 기록했다.
  • 모든 최신 기술 기반 OOD 방법들, 즉 ODIN, MCD, Mahalanobis 등은 분포 외 입력의 이웃 영역에서 worst-case 편향에 실패했지만, CCU는 전체 영역에서 낮은 신뢰도를 유지했다.
  • 이 방법은 전체 이웃 영역에 대해 수학적 신뢰도 상한을 제공하며, 이는 노이즈 이미지 주변의 작은 구 내에서의 적대적 편향이 모델의 신뢰도를 인증된 상한을 초과하게 만들 수 없다는 사실로 입증된다.
  • LSUN-CC와 ImageNet-Noise와 같은 도전적인 OOD 벤치마크에서도 CCU는 높은 성능을 유지했으며, LSUN-CC에서는 98.6% AUC, ImageNet-Noise에서는 97.0% AUC를 기록했다.
  • 가우시안 믹스처 모델을 밀도 추정기로 사용함으로써 이러한 공식적 보장을 도출할 수 있었으며, 이는 표준 VAE나 GAN에서는 달성할 수 없는 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.