Skip to main content
QUICK REVIEW

[논문 리뷰] PI3NN: Out-of-distribution-aware prediction intervals from three neural networks

Siyan Liu, Pei Zhang|arXiv (Cornell University)|2021. 08. 05.
Gaussian Processes and Bayesian Inference참고 문헌 23인용 수 7
한 줄 요약

PI3NN는 표준 평균 제곱 오차 손실을 사용하는 세 개의 독립적으로 훈련된 신경망을 통해 분포 외 예측 구간을 구축하는 새로운 방법이다. 이 방법은 재훈련 없이도 신뢰 수준에 관계없이 예측 구간을 계산할 수 있으며, 교차 문제를 피하고 간단한 초기화 기법을 통해 분포 외 탐지 성능을 향상시켜 벤치마크 및 실세계 데이터셋에서 최신 기법들보다 우수한 불확실성 캘리브레이션과 내구성 성능을 보였다.

ABSTRACT

We propose a novel prediction interval (PI) method for uncertainty quantification, which addresses three major issues with the state-of-the-art PI methods. First, existing PI methods require retraining of neural networks (NNs) for every given confidence level and suffer from the crossing issue in calculating multiple PIs. Second, they usually rely on customized loss functions with extra sensitive hyperparameters for which fine tuning is required to achieve a well-calibrated PI. Third, they usually underestimate uncertainties of out-of-distribution (OOD) samples leading to over-confident PIs. Our PI3NN method calculates PIs from linear combinations of three NNs, each of which is independently trained using the standard mean squared error loss. The coefficients of the linear combinations are computed using root-finding algorithms to ensure tight PIs for a given confidence level. We theoretically prove that PI3NN can calculate PIs for a series of confidence levels without retraining NNs and it completely avoids the crossing issue. Additionally, PI3NN does not introduce any unusual hyperparameters resulting in a stable performance. Furthermore, we address OOD identification challenge by introducing an initialization scheme which provides reasonably larger PIs of the OOD samples than those of the in-distribution samples. Benchmark and real-world experiments show that our method outperforms several state-of-the-art approaches with respect to predictive uncertainty quality, robustness, and OOD samples identification.

연구 동기 및 목표

  • 기존 예측 구간(PI) 방법의 한계를 해결하기 위해, 각 신뢰 수준에서 재훈련이 필요로 하는 문제와 분포 외(OOD) 샘플에 대한 낮은 처리 능력을 해결하고자 한다.
  • 다양한 신뢰 수준에서의 다중 PI 추정에서 발생하는 교차 문제를 제거하고자 한다.
  • 맞춤형 손실 함수나 민감한 하이퍼파rameter 조정이 필요 없는 PI 방법을 개발하고자 한다.
  • 새로운 초기화 기법을 통해 OOD 샘플에 대해 더 넓은 PI를 제공하여 OOD 탐지 성능을 향상시키고자 한다.

제안 방법

  • PI3NN는 특수한 손실 함수나 하이퍼파rameter 조정 없이 표준 평균 제곱 오차(MSE) 손실을 사용하여 세 개의 별도 신경망을 훈련한다.
  • 예측 구간은 세 개의 네트워크 출력의 선형 조합으로 구성되며, 목표하는 신뢰 수준을 확보하기 위해 근 찾기 알고리즘을 통해 계수를 도출한다.
  • 이론적으로, 캘리브레이션 조건을 만족하는 모델의 가족을 활용함으로써 다양한 신뢰 수준에서의 비교교차(Non-crossing) PI를 보장한다.
  • 세 개의 네트워크 출력의 산란도를 기반으로 신뢰도 점수를 계산하며, 더 큰 산란은 높은 불확실성과 잠재적인 OOD 상태를 나타낸다.
  • 분포 외 영역에서 더 큰 조각별 선형 영역을 촉진하는 초기화 기법을 도입하여 OOD 영역에서의 PI 폭을 증가시킨다.
  • 세 개의 네트워크가 한 번만 훈련되어 재사용되기 때문에, 재훈련 없이도 다양한 신뢰 수준에서의 PI 계산이 가능하다.

실험 결과

연구 질문

  • RQ1각 신뢰 수준에서 재훈련이 필요로 하지 않으면서도 다중 PI 추정에서 교차 문제를 피할 수 있는 PI 방법을 설계할 수 있는가?
  • RQ2복잡한 손실 함수나 민감한 하이퍼파rameter 조정 없이도 잘 캘리브레이션된 불확실성 추정을 달성할 수 있는가?
  • RQ3불확실성 정량화를 통해 OOD 샘플을 효과적으로 식별할 수 있으며, 이러한 샘플에 대해 자연스럽게 PI가 넓어지는가?
  • RQ4제안된 초기화 기법이 분포 외 입력에 대해 PI 폭을 증가시켜 OOD 탐지 성능을 향상시키는가?
  • RQ5실세계 및 벤치마크 데이터셋에서 PI3NN은 최신 기법들에 비해 예측 불확실성 품질, 내구성 및 OOD 식별 능력 측면에서 어떻게 비교되는가?

주요 결과

  • PI3NN는 세 개의 네트워크를 한 번만 훈련하고 모든 수준에서 재사용함으로써 재훈련 없이도 다양한 신뢰 수준에서 PI를 성공적으로 계산한다.
  • 이론적 분석(3.2.1절)을 통해 PI 추정에서 교차 문제를 완전히 방지함을 입증했다.
  • 비행 지연 데이터셋에서 OOD 식별 기능을 켠 PI3NN는 랭크 1 공항(OOD)에 대해 0.24±0.05의 신뢰도 점수를 기록했으며, OOD 탐지 기능을 끈 PI3NN의 0.72±0.32 점수보다 유의미하게 낮게 나타나 효과적인 OOD 탐지 성능을 입증했다.
  • PI3NN는 QD, PIVEN, SQR, DER 등의 베이스라인보다 데이터 분포 이동(훈련 데이터의 랭크 4에서 더 큰 공항 랭크 1~3로의 이동)을 효과적으로 탐지했으며, 후자 기법들은 이 이동을 탐지하지 못했다.
  • 훈련에 표준 MSE 손실만 사용하기 때문에 손실 하이퍼파rameter의 미세조정이 필요 없어 안정적인 성능을 보였다.
  • 실험 결과, 특히 넓어진 PI를 통해 OOD 샘플을 구분하는 데서 최신 기법들보다 더 나은 불확실성 캘리브레이션과 내구성 성능을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.