Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian Image Classification with Deep Convolutional Gaussian Processes

Vincent Dutordoir, Mark van der Wilk|arXiv (Cornell University)|2019. 02. 15.
Gaussian Processes and Bayesian Inference참고 문헌 27인용 수 4
한 줄 요약

이 논문은 깊이 있는 컨volution형 가우시안 프로세스를 위한 번역에 민감하지 않은 컨볼루션 커널(TICK)을 도입하여, 엄격한 이동 불변성 조건을 완화함으로써 이미지 분류에서 더 나은 불확실성 캘리브레이션과 정확도를 달성한다. 이 방법은 MNIST 및 CIFAR-10에서 최신 기술 수준의 성능을 달성하며, 표준 컨볼루션 GPs와 드롭아웃 기반 베이지안 딥 러닝 모두를 정확도와 마진널 가능도 기반 하이퍼파rameter 튜닝 측면에서 능가한다.

ABSTRACT

In decision-making systems, it is important to have classifiers that have calibrated uncertainties, with an optimisation objective that can be used for automated model selection and training. Gaussian processes (GPs) provide uncertainty estimates and a marginal likelihood objective, but their weak inductive biases lead to inferior accuracy. This has limited their applicability in certain tasks (e.g. image classification). We propose a translation-insensitive convolutional kernel, which relaxes the translation invariance constraint imposed by previous convolutional GPs. We show how we can use the marginal likelihood to learn the degree of insensitivity. We also reformulate GP image-to-image convolutional mappings as multi-output GPs, leading to deep convolutional GPs. We show experimentally that our new kernel improves performance in both single-layer and deep models. We also demonstrate that our fully Bayesian approach improves on dropout-based Bayesian deep learning methods in terms of uncertainty and marginal likelihood estimates.

연구 동기 및 목표

  • 기존의 컨볼루션 가우시안 프로세스가 엄격한 이동 불변성을 강요함으로써 이미지 데이터에서 모델의 유연성과 성능이 제한되는 문제를 해결한다.
  • 더 유연한 인덕티브 바이어스를 통합함으로써 베이지안 이미지 분류에서 불확실성 정량화와 모델 캘리브레이션을 향상시킨다.
  • 완전한 베이지안 프레임워크 내에서 마진널 가능도를 활용해 자동 하이퍼파rameter 선택을 가능하게 하여, 드롭아웃 기반 베이지안 딥 러닝의 핵심적 한계를 극복한다.
  • 깊이 있는 컨볼루션 GP 레이어를 상관관계가 있는 다중 출력 가우시안 프로세스로 재구성하여 효율적이고 확장 가능한 훈련과 추론을 지원한다.
  • 베이지안 추론이 적용되더라도 사전 분포에 더 나은 인덕티브 바이어스를 제공할 경우 후행 분포 근사와 모델 성능이 향상됨을 보여준다.

제안 방법

  • 동일한 패치가 동일한 출력을 생성해야 한다는 요구 조건을 완화하여 더 민감한 특징 학습이 가능한 번역에 민감하지 않은 컨볼루션 커널(TICK)을 제안한다.
  • 딥 GPs 내의 이미지 간 컨볼루션 매핑을 다중 출력 가우시안 프로세스로 재구성하여 일반적인 다중 출력 GP 프레임워크를 활용한 효율적 추론을 가능하게 한다.
  • 유도 점을 사용한 스토케스틱 변분 추론을 적용하여 대규모 데이터셋에 대한 확장성을 확보하면서도 계산 효율성을 유지한다.
  • 하이퍼파rameter 최적화를 위한 목적함수로 마진널 가능도를 활용하여 자동 모델 선택과 정규화를 가능하게 한다.
  • 재사용 가능한 오픈소스 다중 출력 GP 프레임워크(van der Wilk 등, 2020) 내에 모델을 구현하여 모듈러하고 확장 가능한 코드를 지원한다.
  • 단일 레이어 및 딥 아키텍처 모두에 모델을 적용하여 표준 컨볼루션 GPs와 베이지안 딥 러닝 기준선 대비 일관된 성능 향상을 입증한다.

실험 결과

연구 질문

  • RQ1컨볼루션 가우시안 프로세스에서 이동 불변성을 완화하면 이미지 분류 작업에서 성능 향상이 이루어지는가?
  • RQ2제안된 다중 출력 GP 설정은 깊이 있는 컨볼루션 GPs의 효율적이고 확장 가능한 훈련을 가능하게 하는가?
  • RQ3드롭아웃 기반 베이지안 딥 러닝과 달리, 제안된 프레임워크에서 마진널 가능도를 효과적으로 하이퍼파rameter 튜닝에 활용할 수 있는가?
  • RQ4제안된 방법의 불확실성 캘리브레이션은 표준 이미지 벤치마크에서 드롭아웃 기반 베이지안 신경망과 비교해 어떻게 되는가?
  • RQ5사전 분포에 향상된 인덕티브 바이어스가 적용될 경우, 후행 분포 근사와 이미지 분류 성능에 얼마나 긍정적인 영향을 미치는가?

주요 결과

  • 딥 TICK-GP 모델은 MNIST에서 99.33%의 top-1 정확도를 달성하여 표준 딥 GPs의 98% 및 비컨볼루션 딥 GPs의 98%를 능가한다.
  • CIFAR-10에서는 딥 TICK-GP가 74.41%의 top-1 정확도를 기록하여 비컨볼루션 딥 GPs 기준선의 47.26%를 크게 앞서며 성능을 뛰어나게 한다.
  • 3층 구조에서 MNIST의 top-1 오차를 0.64%로 줄였고, 표준 컨볼루션 GPs의 0.93%보다 우수한 정확도를 확보하였다.
  • 3층에서 MNIST에서 NLL(0.02)과 음의 ELBO(4.19 × 10³)가 낮아, 기준선 대비 더 나은 불확실성 캘리브레이션과 모델 적합도를 보였다.
  • 드롭아웃 기반 베이지안 딥 러닝과 달리, 제안된 방법에서의 마진널 가능도 추정치는 하이퍼파rameter 선택에 유용하게 사용될 수 있다.
  • TICK 커널은 MNIST 및 CIFAR-10에서 모든 깊이 설정에서 표준 컨볼루션 GPs를 일관되게 능가하며, 정확도와 불확실성 정량화 측면에서 모두 향상된 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.