Skip to main content
QUICK REVIEW

[論文レビュー] missIWAE: Deep Generative Modelling and Imputation of Incomplete Data.

Pierre‐Alexandre Mattei, Jes Frellsen|arXiv (Cornell University)|Dec 6, 2018
Domain Adaptation and Few-Shot Learning参考文献 55被引用数 16
ひとこと要約

この論文では、欠損値がランダムに発生するデータ(MAR)を扱えるように重要度重み付きオートエンコーダ(IWAE)を拡張した、MIWAEと呼ばれる深層生成モデル手法を提案する。計算コストの増加なしに、観測データの対数尤度のタイトな下界を最大化することで、正確な単一および複数の補完が可能となり、完全なデータで学習したモデルと同等の性能を達成する。MNISTやその他のベンチマークで実証された。

ABSTRACT

We consider the problem of handling missing data with deep latent variable models (DLVMs). First, we present a simple technique to train DLVMs when the training set contains missing-at-random data. Our approach, called MIWAE, is based on the importance-weighted autoencoder (IWAE), and maximises a potentially tight lower bound of the log-likelihood of the observed data. Compared to the original IWAE, our algorithm does not induce any additional computational overhead due to the missing data. We also develop Monte Carlo techniques for single and multiple imputation using a DLVM trained on an incomplete data set. We illustrate our approach by training a convolutional DLVM on a static binarisation of MNIST that contains 50% of missing pixels. Leveraging multiple imputation, a convolutional network trained on these incomplete digits has a test performance similar to one trained on complete data. On various continuous and binary data sets, we also show that MIWAE provides accurate single imputations, and is highly competitive with state-of-the-art methods.

研究の動機と目的

  • 欠損値がランダムに発生する(MAR)データ上で深層潜在変数モデル(DLVM)を学習する課題に対処すること。
  • 重要度重み付きオートエンコーダ(IWAE)の利点を維持しつつ、計算コストを増加させることなく不完全なデータに適応する手法を開発すること。
  • 不完全なデータで学習したDLVMを用いて、効果的な単一および複数の補完を可能にすること。
  • MIWAEで学習したモデルが、完全なデータで学習したモデルと同等のテスト性能を達成することを示すこと。

提案手法

  • 欠損値がランダムに発生する条件下で、観測データの対数尤度の下界を最大化するMIWAEというIWAEの変種を提案する。
  • 重要度重み推定フレームワークを不完全なデータに適応させるために、欠損値を考慮した重みの修正を実施する。
  • 訓練済みのMIWAEモデルを用いて、単一および複数の補完を実現するモンテカルロ技術を導入する。
  • 欠損データが存在しても追加のオーバーヘッドを回避することで、計算効率を維持する。
  • 複雑なデータ分布(例:50%のピクセルが欠損しているバイナリ化MNIST)をモデル化するため、畳み込みDLVMアーキテクチャを用いる。
  • 再パラメータライゼーションと確率的勾配推定を用いて、不完全なデータ上でエンドツーエンドの学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1修正された重要度重み付きオートエンコーダフレームワークを用いて、欠損値がランダムに発生するデータ上で、深層生成モデルを効果的に学習できるか?
  • RQ2標準的なIWAEと比較して、提案手法MIWAEは欠損データを処理する際も計算効率を維持できるか?
  • RQ3MIWAEは、完全なデータで学習したモデルと同等の性能を示す正確な単一および複数の補完を提供できるか?
  • RQ4多様な連続的およびバイナリーデータセットにおいて、MIWAEは最先端の補完手法と比較して優れた性能を示すか?

主な発見

  • 50%のピクセルが欠損しているバイナリ化MNISTデータセットにおいて、MIWAEで補完されたデータで学習した畳み込みネットワークは、完全なデータで学習したモデルと同等のテスト性能を達成した。
  • MIWAEは、さまざまな連続的およびバイナリーデータセットで正確な単一補完を提供し、最先端の手法を上回るか同等の性能を示した。
  • 欠損データが存在しても、訓練中に追加の計算オーバーヘッドが生じず、IWAEの効率性を保ったままだった。
  • MIWAEを用いた複数補完は、下流のモデルの汎化性能を向上させ、不確実性を考慮した補完の有効性を示した。
  • MIWAEフレームワークは、観測データの対数尤度に対してタイトな下界を達成しており、不完全なデータに対する強いモデル適合を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。