Skip to main content
QUICK REVIEW

[논문 리뷰] Ensemble Model Patching: A Parameter-Efficient Variational Bayesian Neural Network

Oscar Chang, Yuling Yao|arXiv (Cornell University)|2019. 05. 23.
Advanced Neural Network Applications참고 문헌 58인용 수 5
한 줄 요약

이 논문은 ResNet-18과 같은 대규모 딥 네트워크에서 최소한의 오버헤드로 베이지안 불확실성 추정을 가능하게 하는 파rameter 효율적인 변동 베이지안 신경망 방법인 앙상블 모델 패치를 제안한다. 앙상블 기반 베이지안 신경망를 위한 일반적인 변동 가족을 구성함으로써, 이 방법은 근사적인 영향을 주지 않는 파라미터 및 프로그래밍 오버헤드를 달성하며, 비베이지안 학습과 유사한 수준의 성능을 보이며 ImageNet에서 정확도, 校정성, 내구성 면에서 MC 드롭아웃을 능가한다. 이로 인해 근사적으로 완벽한 校정성을 달성한다.

ABSTRACT

Two main obstacles preventing the widespread adoption of variational Bayesian neural networks are the high parameter overhead that makes them infeasible on large networks, and the difficulty of implementation, which can be thought of as "programming overhead." MC dropout [Gal and Ghahramani, 2016] is popular because it sidesteps these obstacles. Nevertheless, dropout is often harmful to model performance when used in networks with batch normalization layers [Li et al., 2018], which are an indispensable part of modern neural networks. We construct a general variational family for ensemble-based Bayesian neural networks that encompasses dropout as a special case. We further present two specific members of this family that work well with batch normalization layers, while retaining the benefits of low parameter and programming overhead, comparable to non-Bayesian training. Our proposed methods improve predictive accuracy and achieve almost perfect calibration on a ResNet-18 trained with ImageNet.

연구 동기 및 목표

  • 대규모 모델에서 변동 베이지안 신경망의 보편적인 적용을 저해하는 높은 파라미터 및 프로그래밍 오버헤드 문제를 해결하기 위해.
  • MC 드롭아웃이 자주 실패하는 배치 정규화 레이어와 효과적으로 작동하는 베이지안 방법을 개발하기 위해.
  • 기존 훈련 파이프라인에 최소한의 변경으로 현대 아키텍처인 ResNet-18 및 PyramidNet과 같은 대규모 모델에서 확장 가능한 베이지안 딥 러닝을 가능하게 하기 위해.
  • ImageNet과 같은 대규모 데이터셋에서 최고 수준의 불확실성 校정성과 예측 성능를 달성하기 위해.
  • 아키텍처 수정 없이 표준 레이어에 대한 일대일 대체가 가능하게 하여 구현의 용이성을 보장하기 위해.

제안 방법

  • 암시적 및 명시적 앙상블을 통합하는 앙상블 기반 베이지안 신경망를 위한 일반적인 변동 가족을 제안하며, 이는 드롭아웃을 특수 케이스로 포함한다.
  • 배치 정규화와 호환되며 깊은 네트워크로 확장 가능한 두 가지 새로운 변동 분포인 앙상블 모델 패치(EMP) 및 그 변형인 ECMP를 도입한다.
  • 각 가중치가 학습 가능한 파라미터 앙상블로 대체되는 패치 기반 파arameter화를 사용하여, 낮은 파라미터 오버헤드(ResNet-18 기준 17.9%)와 효율적인 추론을 가능하게 한다.
  • 예측 불확실성 추정을 위해 추론 중 몬테 카를로 샘플링을 사용하지만, 비베이지안 표준 훈련과 유사한 계산 비용을 유지한다.
  • 완전 연결 및 컨볼루션 레이어에 대한 플러그인 대체로 적용되며, 네트워크 아키텍처나 역전파에 대한 변경 없이 작동한다.
  • 재파rameterization 기법을 활용하여 앙상블 파라미터의 미분 가능 훈련을 가능하게 하여 종단 간 최적화를 보장한다.

실험 결과

연구 질문

  • RQ1대규모 데이터셋에서 높은 성능를 유지하면서 근사적인 영향을 주지 않는 파라미터 오버헤드로 베이지안 신경망을 훈련시킬 수 있는가?
  • RQ2자주 MC 드롭아웃을 방해하는 배치 정규화 레이어와 베이지안 불확실성 추정을 어떻게 통합할 수 있는가?
  • RQ3앙상블 기반 변동 추론이 깊은 잔차 네트워크에서 MC 드롭아웃보다 더 나은 校정성과 내구성을 달성할 수 있는가?
  • RQ4최소한의 계산 및 구현 비용으로 ImageNet 수준의 모델에 베이지안 신경망을 확장하는 것이 가능한가?
  • RQ5암시적 및 명시적 앙샘블링 방법을 하나의 프레임워크 안에서 통합할 수 있는 일반적인 변동 가족을 구성할 수 있는가?

주요 결과

  • Ensemble Model Patching는 ResNet-18을 사용해 ImageNet에서 근사적으로 완벽한 校정성을 달성하며, MC 드롭아웃 및 비베이지안 모델을 모두 능가한다.
  • ResNet-18 기준 파라미터 오버헤드는 17.9%에 불과하며, 평균 필드 가우시안의 100% 및 MNFG의 29900%에 비해 매우 확장 가능하다.
  • 다양한 회귀 데이터셋에서 EMP 및 ECMP는 테스트 로그우도 및 불확실성 校정성 면에서 모두 MC 드롭아웃 및 비베이지안 기준선을 일관되게 능가한다.
  • 제안된 방법은 표준 비베이지안 훈련과 유사한 계산 비용과 훈련 시간을 유지하여 실용적인 구현이 가능하다.
  • 실험 결과에 따르면 EMP는 일반적인 이미지 손상에 대해 강건성을 향상시켜 분포 이탈 하에서도 더 나은 일반화 성능를 보여준다.
  • 이 방법은 베이지안 신경망을 ImageNet 데이터셋까지 성공적으로 확장한 최초의 방법으로, 최고 수준의 校정성과 정확도를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.