Skip to main content
QUICK REVIEW

[논문 리뷰] The Hidden Uncertainty in a Neural Networks Activations

Janis Postels, Hermann Blum|arXiv (Cornell University)|2020. 12. 05.
Adversarial Robustness in Machine Learning참고 문헌 59인용 수 12
한 줄 요약

이 논문은 신경망 활성화의 밀도를 사전적 불확실성과 앨레아토릭 불확실성의 대체 지표로 사용하여 재학습 없이도 효율적인 불확실성 추정을 가능하게 한다. 깊이 있는 레이어 표현은 몬테카를로 드롭아웃과 딥 앙상블과 유사한 계산 비용이 큰 기법들과 밀도적으로 유사한 불확실성 추정을 제공하는 반면, 단순한 정규화는 최소한의 학습 오버헤드로 OOD 탐지 성능을 더욱 향상시킨다.

ABSTRACT

The distribution of a neural network's latent representations has been successfully used to detect out-of-distribution (OOD) data. This work investigates whether this distribution moreover correlates with a model's epistemic uncertainty, thus indicates its ability to generalise to novel inputs. We first empirically verify that epistemic uncertainty can be identified with the surprise, thus the negative log-likelihood, of observing a particular latent representation. Moreover, we demonstrate that the output-conditional distribution of hidden representations also allows quantifying aleatoric uncertainty via the entropy of the predictive distribution. We analyse epistemic and aleatoric uncertainty inferred from the representations of different layers and conclude that deeper layers lead to uncertainty with similar behaviour as established - but computationally more expensive - methods (e.g. deep ensembles). While our approach does not require modifying the training process, we follow prior work and experiment with an additional regularising loss that increases the information in the latent representations. We find that this leads to improved OOD detection of epistemic uncertainty at the cost of ambiguous calibration close to the data distribution. We verify our findings on both classification and regression models.

연구 동기 및 목표

  • 신경망 활성화의 분포가 사전적 불확실성, 즉 모델의 새로운 입력에 대한 일반화 능력과 관련이 있는지 조사하는 것.
  • 은닉 표현이 출력 조건부 밀도 추정을 통해 앨레아토릭 불확실성까지도 측정할 수 있는지 확인하는 것.
  • 잠재 표현에서 유도된 불확실성 추정이 몬테카를로 드롭아웃과 딥 앙상블과 같은 기존의 계산 비용이 큰 방법들과 성능이 유사한지 평가하는 것.
  • 학습 시 정규화의 영향을 불확실성 추정 품질과 OOD 탐지 성능 측면에서 평가하는 것.
  • 분류 및 회귀 모델 모두에 적용 가능한 실용적인 학습 후 불확실성 추정 프레임워크를 제공하는 것.

제안 방법

  • 은닉 표현의 음의 로그우도(놀라움)를 통해 사전적 불확실성을 추정하며, 낮은 밀도 영역을 데이터 분포 외 입력을 나타내는 지표로 간주한다.
  • 은닉 표현 조건부 예측 분포의 엔트로피를 사용해 앨레아토릭 불확실성을 측정함으로써, 특히 회귀 과제에서의 불확실성 추정을 가능하게 한다.
  • 구조적 수정 없이 표준 신경망을 학습한 후, 사전 학습된 은닉 활성화에서 불확실성을 추출한다.
  • 은닉 공간의 정보량을 증가시키기 위해 학습 중 복원 기반 정규화 손실을 적용함으로써 불확실성 품질을 향상시킨다.
  • 잠재 표현의 밀도를 추정하기 위해 가우시안 믹스처 모델(GMMs) 또는 노멀라이징 플로우(NFs)를 사용한다.
  • OOD 탐지의 AUROC과 앨레아토릭 불확실성의 예측 오차와의 상관관계를 사용해 불확실성 성능을 평가한다.

실험 결과

연구 질문

  • RQ1은닉 활성화의 밀도가 사전적 불확실성의 신뢰할 수 있는 대체 지표가 될 수 있는가, 즉 모델의 일반화 능력을 나타내는가?
  • RQ2은닉 표현의 출력 조건부 분포가 특히 회귀 과제에서 앨레아토릭 불확실성을 추정하는 데에도 활용될 수 있는가?
  • RQ3다양한 네트워크 깊이에서의 불확실성 추정은 몬테카를로 드롭아웃과 딥 앙상블과 같은 기존 방법들과 어떻게 비교되는가?
  • RQ4학습 중에 복원 손실을 추가하면 OOD 탐지 성능이 향상되는가, 그리고 데이터 분포 근처에서 校정(calibration)에 어떤 상충관계가 존재하는가?
  • RQ5모델 구조를 수정하거나 재학습 없이도 학습 후 불확실성 추정을 효과적으로 적용할 수 있는가?

주요 결과

  • 더 깊은 레이어의 활성화 밀도는 몬테카를로 드롭아웃과 딥 앙상블과 유사한 사전적 불확실성 추정을 제공하지만, 계산 비용은 훨씬 낮다.
  • 얕은 레이어 표현은 더 보수적인 OOD 탐지 성능을 보이며, 추가 학습 없이도 여러 OOD 벤치마크에서 딥 앙상블을 능가한다.
  • 학습 중에 복원 손실을 추가하면 OOD 탐지 성능이 크게 향상되지만, 훈련 데이터 분포 근처에서는 교정이 모호해진다.
  • 더 깊은 레이어에서 유도된 앨레아토릭 불확실성은 기존 방법과 유사한 교정 행동을 보이며, 그 신뢰성을 검증한다.
  • 이 방법은 모델 구조 변경 없이도 학습 후에 불확실성 추정을 가능하게 하여 실세계 적용에 적합한 확장 가능한 실용적 솔루션을 제공한다.
  • 정규화 가중치의 선택이 매우 중요하다: 서로 다른 가중치는 동일한 정확도를 유지하지만 데이터 분포 근처에서는 AUROC 곡선이 매우 다를 수 있어 최적의 하이퍼파rameter 선택이 복잡해진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.