Skip to main content
QUICK REVIEW

[논문 리뷰] Sparse Uncertainty Representation in Deep Learning with Inducing Weights

Hippolyt Ritter, Martin Kukla|arXiv (Cornell University)|2021. 05. 30.
Gaussian Processes and Bayesian Inference참고 문헌 71인용 수 4
한 줄 요약

이 논문은 저차원 보조 파rameter인 유도 가중치를 제안한다. 이는 불확실성 정량화를 압축된 공간으로 투영함으로써 메모리 효율적인 베이지안 신경망과 딥 앙상블을 가능하게 한다. 메이서론의 조건부 가우시안 샘플링 규칙을 확장함으로써, 이 방법은 최대 75.7%의 파rameter 감소를 이끌어내며 경쟁 가능한 불확실성 추정과 정확도를 유지한다. 표준 네트워크 대비 파rameter 수를 ≤24.3%로 줄였으며, ResNet과 완전 연결 네트워크에서 뛰어난 성능을 유지를 한다.

ABSTRACT

Bayesian neural networks and deep ensembles represent two modern paradigms of uncertainty quantification in deep learning. Yet these approaches struggle to scale mainly due to memory inefficiency issues, since they require parameter storage several times higher than their deterministic counterparts. To address this, we augment the weight matrix of each layer with a small number of inducing weights, thereby projecting the uncertainty quantification into such low dimensional spaces. We further extend Matheron's conditional Gaussian sampling rule to enable fast weight sampling, which enables our inference method to maintain reasonable run-time as compared with ensembles. Importantly, our approach achieves competitive performance to the state-of-the-art in prediction and uncertainty estimation tasks with fully connected neural networks and ResNets, while reducing the parameter size to $\leq 24.3\%$ of that of a $single$ neural network.

연구 동기 및 목표

  • 베이지안 신경망(BNNs)과 딥 앙상블이 결정론적 네트워크보다 훨씬 더 많은 파rameter를 요구함에 따라 발생하는 높은 메모리 비용을 해결하기 위함.
  • 기존에 메모리 효율성으로 알려진 희소 가우시안 프로세스 기법을, 전체 너비가 유한한 딥 신경망에 유도 가중치를 통해 확장하기 위함.
  • 예측 성능나 캘리브레이션을 희생시키지 않고도 효율적인 사후 샘플링과 불확실성 정량화를 가능하게 하기 위함.
  • 특히 자원이 제한된 장치에 구현하기 위한 전체 BNNs와 딥 앙상블의 파rameter 효율적인 대안을 제공하기 위함.
  • 불확실성이 전체 가중치 공간의 저차원 부분공간에 효과적으로 표현될 수 있으며, 이로 인해 예측 성능나 불확실성 추정 품질이 손상되지 않는지를 입증하기 위함.

제안 방법

  • 전체 가중치 행렬에서 불확실성을 투영하는 저차원 보조 변수인 유도 가중치를 도입함으로써 파rameter 수를 감소시킴.
  • 전체 가중치가 아닌 유도 가중치에 대해 완전 분산 가우시안(FFG) 사후 분포를 사용한 변분 추론을 적용함.
  • 빠르고 효율적인 사후 분포에서의 가중치 샘플링을 가능하게 하기 위해 메이서론의 규칙을 확장함.
  • 각 레이어마다 작은 유도 가중치 행렬을 통해 불확실성을 저차원 공간으로 투영하는 파rameter화 방법을 적용함.
  • 베이지안 신경망과 딥 앙상블 양쪽 모두에 이 프레임워크를 적용하여, 메모리 사용량을 줄인 채로 불확실성 정량화를 가능하게 함.
  • 기본 모델을 최소한의 코드 변경으로 베이지안 모델로 전환할 수 있도록 PyTorch 워핑 라이브러리인 'bayesianize'를 활용함.

실험 결과

연구 질문

  • RQ1딥 러닝에서 희소한 불확실성 표현 방식이 전체 BNNs와 비슷한 성능을 달성하면서도 파라미터 수를 극적으로 줄일 수 있는가?
  • RQ2유도 가중치가 딥 앙상블 수준의 효율적이고 확장 가능한 사후 샘플링을 가능하게 할 수 있는가?
  • RQ3불확실성이 가중치 공간의 저차원 부분공간에 얼마나 정확하게 표현될 수 있는가?
  • RQ4제안된 방법이 표준 BNNs와 딥 앙상블에 비해 캘리브레이션, 정확도, 분포 이탈 상황에서의 강건성 측면에서 어떻게 비교되는가?
  • RQ5이 방법이 ResNet과 같은 현대적 아키텍처에 효과적으로 적용되어 성능 저하 없이 파라미터 효율성을 달성할 수 있는가?

주요 결과

  • 제안된 유도 가중치 방법은 표준 결정론적 네트워크 대비 파라미터 수를 ≤24.3%로 줄였으며, 이미지 분류 작업에서 경쟁 가능한 성능을 유지한다.
  • CIFAR-100에서 100% 유도 가중치 사용 시 11.28%의 테스트 오차를 기록했으며, 이는 전체 BNNs와 딥 앙상블과 유사한 성능이다.
  • 분포 외 검출 성능 측면에서, CIFAR-100에서는 AUC 90.4%, SVHN에서는 AUC 91.2%를 기록했으며, 기준 방법과 동등하거나 이를 초월한다.
  • 손상된 CIFAR-100에서 유도 가중치 방법은 높은 정확도(25% 가중치 사용 시 58.11%)와 낮은 ECE(100% 사용 시 4.64%)를 유지하여 강건성을 입증한다.
  • 메이서론의 규칙을 확장한 덕분에 빠른 추론이 가능하며, 표준 앙상블과 비교해 합리적인 런타임을 유지한다.
  • 이 방법은 BNNs와 딥 앙상블 양쪽 모두에 일반화되어 있으며, 다양한 불확실성 정량화 철학에 걸쳐 넓은 적용 가능성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.