Skip to main content
QUICK REVIEW

[논문 리뷰] Repulsive Deep Ensembles are Bayesian

Francesco D’Angelo, Vincent Fortuin|arXiv (Cornell University)|2021. 06. 22.
Generative Adversarial Networks and Image Synthesis참고 문헌 72인용 수 16
한 줄 요약

이 논문은 웨이트 또는 함수 공간에서 커널화된 반발력을 사용하여 앙상블 구성원 간의 다양성을 보장하는 반발성 딥 엔sembles를 제안한다. 이는 KL 발산의 워샤르슈타인 경사 하강 흐름을 통한 최대 사후확률(MLP) 추론을 진정한 베이지안 추론으로 전환한다. 이 방법은 불확실성 추정과 OOD 탐지에서 향상된 성능을 보이며, 표준 엔셈블이나 SVGD보다 진정한 베이지안 사후분포에 더 가까이 수렴한다.

ABSTRACT

Deep ensembles have recently gained popularity in the deep learning community for their conceptual simplicity and efficiency. However, maintaining functional diversity between ensemble members that are independently trained with gradient descent is challenging. This can lead to pathologies when adding more ensemble members, such as a saturation of the ensemble performance, which converges to the performance of a single model. Moreover, this does not only affect the quality of its predictions, but even more so the uncertainty estimates of the ensemble, and thus its performance on out-of-distribution data. We hypothesize that this limitation can be overcome by discouraging different ensemble members from collapsing to the same function. To this end, we introduce a kernelized repulsive term in the update rule of the deep ensembles. We show that this simple modification not only enforces and maintains diversity among the members but, even more importantly, transforms the maximum a posteriori inference into proper Bayesian inference. Namely, we show that the training dynamics of our proposed repulsive ensembles follow a Wasserstein gradient flow of the KL divergence with the true posterior. We study repulsive terms in weight and function space and empirically compare their performance to standard ensembles and Bayesian baselines on synthetic and real-world prediction tasks.

연구 동기 및 목표

  • 표준 딥 엔셈블에서 다양성 부족과 수렴 보장의 문제를 해결하기 위해, 이는 종종 유사한 함수로 수렴하고 진정한 베이지안 사후분포를 근사하지 못함.
  • 베이지안 신경망에서 서로 다른 가중치가 동일한 함수를 맵핑하는 비동일성 문제를 해결하기 위해, 이는 계산 자원을 낭비함.
  • 스테인 변분 경사 하강(Stein Variational Gradient Descent, SVGD)에서 영감을 얻은 반발력 요소를 도입하여 딥 엔셈블에 베이지안 수렴 성질을 부여함.
  • 웨이트 공간과 함수 공간에서의 반발성 엔셈블의 성능을 비교하여 예측 불확실성과 이상치 탐지 측면에서 평가함.
  • 이론적으로 이 방법이 KL 발산의 워샤르슈타인 경사 하강 흐름임을 증명하여 딥 엔셈블에 원칙적인 베이지안 해석을 제공함.

제안 방법

  • 딥 엔셈블의 기울기 업데이트 규칙에 커널화된 반발 항을 도입하여 모델 붕괴를 방지하고 기능적 다양성을 보장함.
  • 훈련 동역학을 진정한 사후분포로의 KL 발산에 대한 워샤르슈타인 경사 하강 흐름으로 공식화하여, 베이지안 사후분포로 수렴 가능하게 함.
  • 함수 출력에 대한 SGE(반모수적 가우시안 프로세스) 근사를 사용하여 웨이트 공간(WGD)과 함수 공간(fWGD) 양쪽에서 반발을 구현함.
  • 커널 함수를 사용하여 앙상블 구성원 간의 반발력을 계산하며, 이 힘의 크기는 매개변수 또는 함수 공간에서의 거리에 따라 달라짐.
  • 1D 회귀 및 SVHN을 OOD 데이터로 사용하는 CIFAR-10 분류와 같은 합성 및 실제 작업에 이 방법을 적용함.
  • 정확도, 엔트로피, 불확실성 校정성 등의 지표를 사용하여 제안된 방법을 표준 딥 엔셈블, SVGD, 베이지안 기준선과 비교함.

실험 결과

연구 질문

  • RQ1앙상블 구성원 간의 반발력 도입이 기능적 다양성을 향상시키고 딥 엔셈블의 붕괴를 방지할 수 있는가?
  • RQ2딥 엔셈블의 반발 훈련 동역학이 진정한 사후분포로의 KL 발산에 대한 워샤르슈타인 경사 하강 흐름과 일치하는가?
  • RQ3불확실성 추정 및 OOD 탐지 측면에서 함수 공간 반발과 웨이트 공간 반발은 어떻게 비교되는가?
  • RQ4반발성 엔셈블이 표준 딥 엔셈블과 SVGD보다 더 나은 불확실성 校정성과 일반화 성능을 달성할 수 있는가?
  • RQ5이 방법이 베이지안 신경망의 비동일성 문제를 어느 정도 완화하는가?

주요 결과

  • 제안된 반발성 엔셈블은 1D 회귀 작업에서 상당히 향상된 불확실성 추정 성능을 보이며, 함수 공간 방법(fWGD)이 HMC 사후분포에 매우 가까이 수렴함.
  • CIFAR-10에서 웨이트 공간 반발성 엔셈블(sge-WGD, ssge-WGD)은 엔트로피 기반 OOD 탐지에서 표준 딥 엔셈블과 SVGD를 능가하며, 정확도 85.792%와 불확실성 점수 0.051을 기록함.
  • 함수 공간 반발성 엔셈블(kde-fWGD, sge-fWGD)은 웨이트 공간 대비 더 나은 불확실성 校정성을 보이며, 각각 0.282와 0.288의 불확실성 점수를 기록함.
  • sge-WGD 변종은 CIFAR-10에서 모든 방법 중에서 가장 뛰어난 OOD 탐지 성능을 보이며, 불확실성 점수 0.051과 정확도 85.792%를 기록함.
  • 함수 공간 반발성 엔셈블은 특히 데이터가 제한된 영역에서 중간 불확실성을 더 잘 포착하는 것으로 나타나, 표준 엔셈블과 웨이트 공간 방법보다 뛰어난 성능을 보임.
  • 이론적 분석을 통해 이 방법이 KL 발산의 워샤르슈타인 경사 하강 흐름을 따르며, 딥 엔셈블에 원칙적인 베이지안 해석을 제공함을 확인함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.