Skip to main content
QUICK REVIEW

[논문 리뷰] Training-Free Uncertainty Estimation for Neural Networks

Mi Lu, Hao Wang|arXiv (Cornell University)|2019. 09. 25.
Adversarial Robustness in Machine Learning인용 수 8
한 줄 요약

이 논문은 추론 시 제어된 변형을 가미한 출력 분산을 분석하여 딥 네ural 네트워크에서 불확실성을 추정하는 훈련 불필요 방법 세 가지—infer-transformation, infer-noise, infer-dropout—을 제안한다. 재훈련이나 아키텍처 변경 없이도 이들 방법은 최신의 훈련 의존적 접근보다 비교적 또는 더 우수한 불확실성 추정 성능을 달성할 수 있으며, 불확실성 신호로 사용될 경우 모델 훈련 자체를 향상시킬 수도 있다.

ABSTRACT

Uncertainty estimation is an essential step in the evaluation of the robustness for deep learning models in computer vision, especially when applied in risk-sensitive areas. However, most state-of-the-art deep learning models either fail to obtain uncertainty estimation or need significant modification (e.g., formulating a proper Bayesian treatment) to obtain it. None of the previous methods are able to take an arbitrary model off the shelf and generate uncertainty estimation without retraining or redesigning it. To address this gap, we perform the first systematic exploration into training-free uncertainty estimation. We propose three simple and scalable methods to analyze the variance of output from a trained network under tolerable perturbations: infer-transformation, infer-noise, and infer-dropout. They operate solely during inference, without the need to re-train, re-design, or fine-tune the model, as typically required by other state-of-the-art uncertainty estimation methods. Surprisingly, even without involving such perturbations in training, our methods produce comparable or even better uncertainty estimation when compared to other training-required state-of-the-art methods. Last but not least, we demonstrate that the uncertainty from our proposed methods can be used to improve the neural network training.

연구 동기 및 목표

  • 특히 위험 감수성 있는 컴퓨터 비전 응용 분야에서 일반화 가능한 불확실성 추정의 부족을 해결하기 위해.
  • 재훈련, 베이지안 재구현, 또는 아키텍처 수정을 필요로 하는 기존 방법의 한계를 극복하기 위해.
  • 피팅 조정, 재훈련, 또는 아키텍처 재설계 없이도 어떤 사전 훈련된 모델에 대해서도 불확실성 추정을 가능하게 하기 위해.
  • 추론 시점의 변형만으로도 훈련 의존적 방법과 비교할 만한 견고한 불확실성 추정을 얻을 수 있는지 탐색하기 위해.

제안 방법

  • infer-transformation 제안: 추론 시 입력에 작은 허용 가능한 변형(예: 작은 회전, 자르기)을 적용하고 출력 분산을 측정한다.
  • infer-noise 도입: 추론 시 입력 또는 활성화 레이어에 제어된 소규모 노이즈를 추가하고 출력 분산을 불확실성의 대체 지표로 추적한다.
  • infer-dropout 개발: 동일한 네트워크에 대해 재훈련 없이 추론 시점에 확률적 드롭아웃을 적용하고, 여러 순환 전파 간 분산을 측정한다.
  • 이러한 변형에 따른 다중 전파 간 분산을 직접적으로 모델 불확실성의 추정치로 사용한다.
  • 모든 방법이 추론 시점에서만 작동하도록 보장하며, 훈련 또는 모델 아키텍처에 대한 변경이 필요하지 않다.
  • 이들 방법으로부터 도출된 불확실성 추정치가 재훈련 시 학습 샘플의 가중치를 재조정하는 데 사용될 수 있음을 입증한다.

실험 결과

연구 질문

  • RQ1재훈련이나 아키텍처 변경 없이도 사전 훈련된 딥 네럴 네트워크에서 신뢰할 수 있는 불확실성 추정이 가능할 수 있는가?
  • RQ2추론 시점의 변형(변형, 노이즈, 드롭아웃)이 훈련 의존적 베이지안 방법에 비해 불확실성 추정 품질에서 어떻게 비교되는가?
  • RQ3이 훈련 불필요 방법으로부터 도출된 불확실성 추정치가 재훈련 과정에서 원래 모델의 성능 향상에 기여할 수 있는가?
  • RQ4공간적, 활성화, 확률적 변형과 같은 다양한 변형 유형이 불확실성 추정의 안정성과 정확성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 훈련 불필요 방법들은 최신의 훈련 의존적 방법과 비교해도 유사하거나 더 뛰어난 불확실성 추정 성능을 달성한다.
  • 훈련 시 어떤 변형도 적용하지 않았음에도 불구하고, 이 방법들은 추론 시 분산 분석을 통해 신뢰할 수 있는 불확실성 추정치를 생성한다.
  • infer-noise와 infer-dropout로부터 도출된 불확실성 추정치는 학습 샘플의 재가중치 조정에 사용될 수 있으며, 피팅 조정 시 일반화 성능 향상에 기여한다.
  • 이 방법들은 어떤 사전 훈련된 모델에도 일반적으로 적용 가능하며, 아키텍처 수정이나 재훈련이 필요하지 않다.
  • infer-transformation은 공간 불변성 태스크에서 뛰어난 성능을 보이며, infer-noise와 infer-dropout는 다양한 비전 벤치마크에서 잘 일반화된다.
  • 이 방법은 재훈련이 불가능한 실생활의 위험 감수성 응용 분야에서 불확실성 추정을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.