[論文レビュー] Doubly Reparameterized Gradient Estimators for Monte Carlo Objectives
この論文は、変分推論におけるモンテカルロ目的関数のための、新たな不偏勾配推定器である二重再パラメータ化勾配(DReG)推定器を紹介する。2回の再パラメータ化トリックを適用することにより、Roederら(2017)のものなど、先行する推定器に見られるバイアスを排除し、サンプル数が増加するにつれて分散を著しく低減する。その結果、MNIST、Omniglot、構造予測タスクにおいてIWAE、RWS、JVIの各目的関数で性能が向上する。
Deep latent variable models have become a popular model choice due to the scalable learning algorithms introduced by (Kingma & Welling, 2013; Rezende et al., 2014). These approaches maximize a variational lower bound on the intractable log likelihood of the observed data. Burda et al. (2015) introduced a multi-sample variational bound, IWAE, that is at least as tight as the standard variational lower bound and becomes increasingly tight as the number of samples increases. Counterintuitively, the typical inference network gradient estimator for the IWAE bound performs poorly as the number of samples increases (Rainforth et al., 2018; Le et al., 2018). Roeder et al. (2017) propose an improved gradient estimator, however, are unable to show it is unbiased. We show that it is in fact biased and that the bias can be estimated efficiently with a second application of the reparameterization trick. The doubly reparameterized gradient (DReG) estimator does not suffer as the number of samples increases, resolving the previously raised issues. The same idea can be used to improve many recently introduced training techniques for latent variable models. In particular, we show that this estimator reduces the variance of the IWAE gradient, the reweighted wake-sleep update (RWS) (Bornschein & Bengio, 2014), and the jackknife variational inference (JVI) gradient (Nowozin, 2018). Finally, we show that this computationally efficient, unbiased drop-in gradient estimator translates to improved performance for all three objectives on several modeling tasks.
研究の動機と目的
- サンプル数が増加するにつれて性能が劣化する標準的勾配推定器のIWAEバウンドに対する直感に反する劣化を解明すること。
- Roederら(2017)が提案したIWAEのための勾配推定器に存在するバイアスを同定および定量化すること。
- サンプル数が大きくても低分散を維持できる、不偏かつ計算効率の良い勾配推定器を開発すること。
- 再重み付けウェイクスリープ(RWS)やジャックナイフ変分推論(JVI)を含む、他のマルチサンプル学習手法へその手法を拡張すること。
- DReG推定器が、多様な生成モデルと構造予測タスクにおいて、訓練の安定性と性能の向上を実証的に示すこと。
提案手法
- IWAE目的関数のための不偏勾配推定器を導出するために、2回の再パラメータ化トリックを適用し、DReG推定器を導出する。
- 推定器の導出にあたり、IWAEバウンドの勾配の期待値を、推論ネットワークのパラメータおよび潜在変数の両方に関してとる。
- DReG推定器が不偏であり、特にサンプル数が増加する際、標準的推定器よりも分散が小さいことを示す。
- RWSおよびJVIの目的関数に対しても、同様の二重再パラメータ化原理を適用することで、DReGフレームワークを拡張する。
- 計算コストに変更を加えずに、既存の勾配推定器の即時置換としてDReG推定器を実装する。
- IWAE-DReGおよびRWS-DReGの凸結合(例:混合推定)を用いて、特定のタスクで向上するハイブリッドトレーニング戦略を探索する。
実験結果
リサーチクエスチョン
- RQ1なぜIWAEバウンドの標準的勾配推定器は、サンプル数が増加するにつれて性能が劣化するのか?
- RQ2Roederら(2017)が提案したIWAEのための勾配推定器は真に不偏なのか? もし不偏でなければ、そのバイアスの性質は何か?
- RQ3再パラメータ化トリックの2度目の適用によって、モンテカルロ目的関数の勾配推定におけるバイアスと分散を排除できるか?
- RQ4DReGフレームワークは、RWSやJVIのような他のマルチサンプル変分推論手法へどの程度一般化可能か?
- RQ5DReG推定器は、多様な生成モデルと構造予測タスクにおいて、訓練の安定性とモデル性能の向上を顕著に示すのか?
主な発見
- DReG推定器は、証明可能な不偏性を有し、特にサンプル数が増加する際、標準的推定器と比較して勾配の分散を顕著に低減する。
- DReG推定器は、以前は不偏とされていたが、実際には無視できないバイアスを有するRoederら(2017)の推定器を上回る。
- MNISTおよびOmniglotにおいて、DReG推定器はIWAE、RWS、JVIの3つの目的関数すべてにおいて、テスト時の対数尤度バウンドを向上させ、一貫した分散低減を示す。
- MNISTの下半分を予測する構造予測タスクにおいて、DReGベースの学習は、バイアスありおよび標準的不偏推定器を上回る性能を示すが、RWS-DReGは後期の学習段階で不安定性を示す。
- IWAE-DReGとRWS-DReGの凸結合は、一部のタスクで性能向上をもたらすが、最適な重み付けはタスク依存的である。
- DReG推定器は、元の推定器と同等の計算コストを維持しており、より高い訓練効率と安定性を実現する実用的で即時置換可能な代替手段である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。