Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Semisupervised Learning with Deep Generative Models

Jonathan Gordon, José Miguel Hernández-Lobato|arXiv (Cornell University)|Jun 29, 2017
Gaussian Processes and Bayesian Inference参考文献 17被引用数 16
ひとこと要約

本稿では、不確実性を考慮した予測を可能にするために、完全ベイジアンニューラルネットワーク(BNN)を識別的部品として用いた、深層生成モデルを用いたベイジアン半教師あり学習フレームワークを提案する。確率的入力の導入とギブスサンプリングを用いた事後分布推論により、データとパラメータの両方の不確実性を捉えることができ、合成データ上での精度と不確実性のキャリブレーションにおいて、点推定ベースラインを上回る性能を発揮した。

ABSTRACT

Neural network based generative models with discriminative components are a powerful approach for semi-supervised learning. However, these techniques a) cannot account for model uncertainty in the estimation of the model's discriminative component and b) lack flexibility to capture complex stochastic patterns in the label generation process. To avoid these problems, we first propose to use a discriminative component with stochastic inputs for increased noise flexibility. We show how an efficient Gibbs sampling procedure can marginalize the stochastic inputs when inferring missing labels in this model. Following this, we extend the discriminative component to be fully Bayesian and produce estimates of uncertainty in its parameter values. This opens the door for semi-supervised Bayesian active learning.

研究の動機と目的

  • 既存の深層生成モデルにおける半教師あり学習におけるモデルの不確実性の定量化の欠如に対処すること。
  • 高次元の潜在空間におけるラベル生成の柔軟性を高めるために、確率的入力を備えたベイジアンニューラルネットワークを拡張すること。
  • 潜在変数とモデルパラメータの両方の不確実性を明示的にモデル化することで、共同での半教師あり学習とアクティブラーニングを可能にすること。
  • 予測時に確率的入力と事後重みを周辺化する効率的な推論手順を開発すること。
  • 不確実性を考慮した予測が、特に少数ラベルデータの状況下で、より良い一般化性能と信頼性のキャリブレーションをもたらすことを示すこと。

提案手法

  • ラベルが確率的入力を備えたBNNを介して生成される深層生成モデルを導入し、ラベルの不確実性を柔軟にモデル化可能にする。
  • 入力 $ x $ から潜在変数 $ z $ を推論するための認識ネットワークを用い、スケーラブルな事後分布近似を実現する。
  • ギブスサンプリングを用いて $ y_* $, $ z $, および $ W_y $ を逐次的にサンプリングし、$ y_* $ は事前推定から始めることでバーンインを回避する。
  • 変分推論の効率化のため、$ W_y $ と $ z $ の両方に再パrameterizationを適用し、$ \alpha $-divergence最小化を用いたエビデンス下限(ELBO)を最適化する。
  • 予測分布を計算するために $ W_y $ と $ z $ の完全な事後分布を活用し、予測における不確実性の定量化を可能にする。
  • ラベルありおよびラベルなしデータを統合した共同変分目的関数を用い、$ \alpha = 0.1 \times N_l $ を用いて寄与度をバランスさせる。

実験結果

リサーチクエスチョン

  • RQ1確率的入力を備えたベイジアンニューラルネットワークは、決定的または点推定ベースラインと比較して、半教師あり学習における不確実性の定量化を改善できるか?
  • RQ2確率的入力の周辺化に用いられる提案されたギブスサンプリング手順は、予測性能と不確実性のキャリブレーションにどのような影響を及ぼすか?
  • RQ3モデルは、重みと潜在変数の完全な事後分布推論を活用することで、半教師あり学習とアクティブラーニングを同時にサポートできるか?
  • RQ4BNN部に確率的入力を組み込むことで、決定境界が滑らかになり、ラベル付きデータが少ない状況下での一般化性能が向上するか?
  • RQ5分布外領域におけるモデルの予測不確実性は、標準的な深層生成モデルと比較してどのように異なるか?

主な発見

  • 提案されたSSLAPD手法は、99.7%のテスト精度と-0.01のログ尤度を達成し、DNN(83.6%の精度、-1.20のログ尤度)およびSSLPE(99.2%の精度、-0.07のログ尤度)を大きく上回った。
  • 訓練データから遠い領域では、SSLAPDはより広い信頼区間を示し、パラメータの不確実性を無視する手法と比較して、不確実性のキャリブレーションが優れていることを示した。
  • ラベル付きデータ数 $ N_l > 10 $ の場合、すべてのテストセットで100%の精度に収束し、ラベル付きデータセットのサイズが増加するにつれて収束が速くなり、ELBO値も向上した。
  • 認識ネットワーク $ q_\phi(y_*|x_*) $ からの初期化を伴うギブスサンプリングにより、バーンインを必要とせず、$ T = 10 $ のサンプルで安定した予測が得られた。
  • モデルは実際のデータに類似したサンプルを効果的に生成でき、生成プロセスがデータの背後にある分布を的確に捉えていることを示した。
  • 確率的入力と $ W_y $ の完全な事後分布の活用により、決定境界の滑らかさとロバスト性が向上し、特にラベル付きデータが少ない状況下で顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。