Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Inference with Anchored Ensembles of Neural Networks, and Application to Reinforcement Learning.

Tim Pearce, Nicolas Anastassacos|arXiv (Cornell University)|May 29, 2018
Gaussian Processes and Bayesian Inference参考文献 16被引用数 16
ひとこと要約

本稿では、アンサンブルのベイズ推論を可能にするためにニューラルネットワークアンサンブルをアンカリングする手法を提案し、アンサンブル数およびネットワークサイズが増大する際のガウス過程への収束を証明している。強化学習では、この手法により、小さなアンサンブルでも安定した不確実性駆動型探索が得られ、従来手法に比べて学習の安定性が向上する。

ABSTRACT

The use of ensembles of neural networks (NNs) for the quantification of predictive uncertainty is widespread. However, the current justification is intuitive rather than analytical. This work proposes one minor modification to the normal ensembling methodology, which we prove allows the ensemble to perform Bayesian inference, hence converging to the corresponding Gaussian Process as both the total number of NNs, and the size of each, tend to infinity. This working paper provides early-stage results in a reinforcement learning setting, analysing the practicality of the technique for an ensemble of small, finite number. Using the uncertainty estimates they produce to govern the exploration-exploitation process results in steadier, more stable learning.

研究の動機と目的

  • ニューラルネットワークアンサンブルの不確実性評価における解析的基盤を提供し、直感的根拠にとどまらないものとする。
  • アンカリングを通じて有効なベイズ推論を可能にする、修正されたアンサンブル手法の開発。
  • 有限で小さなスケールのモデルを用いた強化学習におけるアンカリングアンサンブルの実用的性能の評価。
  • アンカリングアンサンブルからの不確実性推定が、強化学習における探索と活用のトレードオフを安定化できるかの評価。
  • 無限幅および無限アンサンブル極限におけるガウス過程への収束を示すこと。

提案手法

  • すべてのネットワークに共通する重みを固定する新しいアンカリング機構を導入し、一貫した関数的挙動を保証する。
  • 共通のバックボーンまたは初期化を共有することで、標準的なアンサンブル学習手順を変更し、アンサンブルメンバーをアンカリングする。
  • アンサンブル数およびネットワーク幅が無限に近づく極限において、アンカリングアンサンブルがガウス過程に収束することを解析的に証明する。
  • アンカリングアンサンブルからの予測不確実性を、強化学習エージェントの探索を誘導するために用いる。
  • 共有構造を持つ小さな有限アンサンブルを学習し、エピステミック不確実性を推定する。
  • 不確実性推定値を強化学習アルゴリズムにおける探索ボーナスとして適用し、学習ダイナミクスの改善を図る。

実験結果

リサーチクエスチョン

  • RQ1アンカリングされたニューラルネットワークアンサンブルは、無限極限において有効なベイズ推論を達成できるか。
  • RQ2アンカリングアンサンブル手法は、標準的なアンサンブル手法と比較して不確実性のキャリブレーション性能に優れているか。
  • RQ3小さな有限サイズのアンカリングアンサンブルは、強化学習における探索の安定性を向上させられるか。
  • RQ4アンカリングアンサンブルからの不確実性は、より一貫性があり信頼性の高い学習軌道をもたらすか。
  • RQ5アンカリングアンサンブルとガウス過程との間の理論的関係は何か。

主な発見

  • アンカリングアンサンブルは、無限幅および無限アンサンブル極限において、解析的にガウス過程に収束することが証明された。
  • アンカリング機構により、アンサンブル不確実性の解析的正当化が可能となり、ヒューリスティックな推論から脱却した。
  • 強化学習において、アンカリングアンサンブルからの不確実性推定値は、より安定的かつ一貫性のある学習曲線をもたらした。
  • 小さな有限アンサンブルでも、意味のある不確実性推定値が得られ、効果的に探索を誘導できた。
  • 実世界の強化学習設定においても実用的であり、標準的なアンサンブル手法に比べて学習の安定性が優れていた。
  • 結果から、アンカリングアンサンブルは深層学習とベイズ非パラメトリック手法の間の橋渡しを果たす可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。