Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Incremental Learning for Deep Neural Networks

Max Kochurov, Timur Garipov|arXiv (Cornell University)|Feb 20, 2018
Domain Adaptation and Few-Shot Learning参考文献 8被引用数 10
ひとこと要約

この論文は、正規化フローを用いた変分推論により事後重み分布を更新するベイジアン段階的学習フレームワークを提案している。これにより、過去のデータを保存せずに、崩壊的忘却を回避する安定的かつ継続的な学習が可能になる。本手法は、MNISTおよびCIFAR-10において、標準的な微調整よりも優れた性能を発揮し、過去のデータからの知識を保持しながら新しいデータの増分に適応する。

ABSTRACT

In industrial machine learning pipelines, data often arrive in parts. Particularly in the case of deep neural networks, it may be too expensive to train the model from scratch each time, so one would rather use a previously learned model and the new data to improve performance. However, deep neural networks are prone to getting stuck in a suboptimal solution when trained on only new data as compared to the full dataset. Our work focuses on a continuous learning setup where the task is always the same and new parts of data arrive sequentially. We apply a Bayesian approach to update the posterior approximation with each new piece of data and find this method to outperform the traditional approach in our experiments.

研究の動機と目的

  • 順次データストリームにおけるディープニューラルネットワークの崩壊的忘却を解消すること。
  • 過去のデータを保存せずに、事後重み分布を段階的に更新できるスケーラブルなベイジアン推論手法を開発すること。
  • 不確実性推定を維持し、局所最適解への陥落を回避することで、順次データにおけるモデル性能を向上させること。
  • 再訓練が不可能な産業用途のパイプラインにベイジアンディープラーニングを適用可能にするための基盤を提供すること。

提案手法

  • 段階的学習のための変分下界を最適化するために、再パrameterizationトリックを用いた確率的変分推論を用いる。
  • ネットワーク重みの複雑で高エントロピーな事後分布をモデル化するために、乗法的正規化フロー(MNF)を適用する。
  • 勾配推定を効率的かつ微分可能にするために、重みwと補助変数zの上での結合変分近似q(w,z)を定義する。
  • 前のステップからの事前分布p_t(w) = q(w|φ_{t-1})を用いることで、データ増分間での事後分布近似の連続性を保証する。
  • 局所的再パラメータ化と解析的KLダイバージェンス項を用いることで、ネストされた期待値を回避する、取り扱い可能な変分下界を導出する。
  • 正規化フローおよび補助変数からのサンプリングにより、不偏なモンテカルロ勾配を用いたエンドツーエンドの学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1正規化フローを用いたベイジアン段階的学習は、継続的学習のシナリオにおいて、標準的な微調整を上回ることができるか?
  • RQ2変分近似族の選択が、段階的学習における安定性と性能に与える影響は何か?
  • RQ3過去のデータにアクセスできない状況でも、スケーラブルなベイジアン手法が予測不確実性を維持し、崩壊的忘却を回避できるか?
  • RQ4重みと補助変数の上での結合事後分布を用いることで、段階的設定における最適化と一般化性能が向上するか?
  • RQ5因子化ガウス分布よりも表現力の高い事後分布近似(例:乗法的正規化フロー)は、精度と収束性の観点で、単純な家族と比較してどのように異なるか?

主な発見

  • 提案されたベイジアン段階的学習手法は、順次データバッチで学習した場合、MNISTおよびCIFAR-10において標準的な微調整よりも高いテスト精度を達成した。
  • 乗法的正規化フローは、完全に因子化されたガウス分布よりも表現力に優れた事後分布近似を提供し、より良い一般化性能と忘却の低減をもたらした。
  • 本手法は、過去のデータにアクセスできない状況下でも、複数のデータ増分にわたり安定した性能を維持し、崩壊的忘却を回避した。
  • 正規化フローを用いた結合変分推論の導入により、不偏な勾配推定が可能な効率的かつ微分可能な学習が可能になった。
  • 本手法は、事前学習済みの非ベイジアンDNNとも互換性があり、既存モデルの段階的適応が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。