Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Image Classification with Deep Convolutional Gaussian Processes

Vincent Dutordoir, Mark van der Wilk|arXiv (Cornell University)|Feb 15, 2019
Gaussian Processes and Bayesian Inference参考文献 27被引用数 4
ひとこと要約

本稿では、深層畳み込みガウス過程における翻訳不変性を緩和することで、画像分類における不確実性のキャリブレーションと精度を向上させる、翻訳に敏感でない畳み込みカーネル(TICK)を導入する。この手法は、MNISTおよびCIFAR-10で最先端の性能を達成し、ドロップアウトに基づくベイジアンディープラーニングと比較して、精度およびマージナル尤度に基づくハイパーパramータチューニングの両面で優れている。

ABSTRACT

In decision-making systems, it is important to have classifiers that have calibrated uncertainties, with an optimisation objective that can be used for automated model selection and training. Gaussian processes (GPs) provide uncertainty estimates and a marginal likelihood objective, but their weak inductive biases lead to inferior accuracy. This has limited their applicability in certain tasks (e.g. image classification). We propose a translation-insensitive convolutional kernel, which relaxes the translation invariance constraint imposed by previous convolutional GPs. We show how we can use the marginal likelihood to learn the degree of insensitivity. We also reformulate GP image-to-image convolutional mappings as multi-output GPs, leading to deep convolutional GPs. We show experimentally that our new kernel improves performance in both single-layer and deep models. We also demonstrate that our fully Bayesian approach improves on dropout-based Bayesian deep learning methods in terms of uncertainty and marginal likelihood estimates.

研究の動機と目的

  • 既存の畳み込みガウス過程が厳密な翻訳不変性を強制するという制限に対処し、画像データにおけるモデルの柔軟性と性能を制限している点を改善する。
  • より柔軟なインダクティブバイアスを組み込むことで、ベイジアン画像分類における不確実性の評価とモデルキャリブレーションを向上させる。
  • 完全ベイジアンフレームワーク内でマージナル尤度を用いることで、ドロップアウトに基づくベイジアンディープラーニングの主要な限界を克服し、自動ハイパーパramータ選択を可能にする。
  • 深層畳み込みガウス過程層を相関のある多出力ガウス過程に再定式化し、効率的でスケーラブルなトレーニングと推論を可能にする。
  • ベイジアン推論が適用されても、事前分布におけるより優れたインダクティブバイアスが、優れた事後分布近似とモデル性能にどのように結びつくかを示す。

提案手法

  • 同一のパッチが同一の出力を生成する必要を緩和する翻訳に敏感でない畳み込みカーネル(TICK)を提案する。これにより、より柔軟な特徴学習が可能になる。
  • 深層ガウス過程における画像間の畳み込みマッピングを多出力ガウス過程として再定式化し、汎用的な多出力ガウス過程フレームワークを用いた効率的な推論を可能にする。
  • 誘導点を用いた確率的変分推論を用いることで、大規模データセットに対しても計算効率を維持しながらスケーリングを実現する。
  • ハイパーパramータ最適化の目的関数としてマージナル尤度を活用し、自動モデル選択と正則化を可能にする。
  • 再利用可能でオープンソースの多出力ガウス過程フレームワーク(van der Wilk et al., 2020)に実装することで、モジュラーや拡張可能なコードを実現する。
  • 単層および深層アーキテクチャの両方に対してモデルを適用し、標準の畳み込みガウス過程およびベイジアンディープラーニングのベースラインと比較して一貫した性能向上を示す。

実験結果

リサーチクエスチョン

  • RQ1畳み込みガウス過程における翻訳不変性の緩和は、画像分類タスクにおける性能向上に寄与するか?
  • RQ2提案された多出力ガウス過程の定式化は、深層畳み込みガウス過程の効率的でスケーラブルなトレーニングを可能にするか?
  • RQ3提案フレームワークにおけるマージナル尤度は、ドロップアウトに基づくベイジアンディープラーニングとは異なり、自動ハイパーパramータチューニングに効果的に利用可能か?
  • RQ4提案手法の不確実性キャリブレーションは、標準の画像ベンチマークにおけるドロップアウトに基づくベイジアンニューラルネットワークと比較してどのように異なるか?
  • RQ5事前分布における改善されたインダクティブバイアスは、画像分類において、どの程度事後分布近似とモデル性能の向上に結びつくか?

主な発見

  • Deep TICK-GPモデルはMNISTで99.33%のトップ-1精度を達成し、標準の深層GP(98%)および非畳み込み型深層GP(98%)を上回っている。
  • CIFAR-10では、Deep TICK-GPが74.41%のトップ-1精度を達成し、非畳み込み型深層GPベースライン(47.26%)を著しく上回っている。
  • 3層構造において、MNISTのトップ-1誤差を0.64%まで低下させた。これは、標準の畳み込みガウス過程(0.93%)よりも優れた精度を示している。
  • 3層構造のMNISTにおいて、NLL(0.02)および負のELBO(4.19 × 10³)が低く抑えられており、ベースラインと比較して不確実性のキャリブレーションとモデル適合度が優れていることを示している。
  • 本手法におけるマージナル尤度推定値は、ハイパーパramータ選択に利用可能である。ドロップアウトに基づくベイジアンディープラーニングとは異なり、このような推定値は信頼性がある。
  • TICKカーネルは、MNISTおよびCIFAR-10の両方において、すべての深さ設定で標準の畳み込みガウス過程を常に上回り、精度および不確実性の評価の両面で改善を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。