Skip to main content
QUICK REVIEW

[論文レビュー] Backprop-Q: Generalized Backpropagation for Stochastic Computation Graphs

Xiaoran Xu, Songpeng Zu|arXiv (Cornell University)|Jul 25, 2018
Reinforcement Learning in Robotics参考文献 36被引用数 3
ひとこと要約

Backprop-Q は、確率的計算グラフ (SCG) における一般化されたバックプロパゲーションフレームワークを提案する。確率的ノードにおける学習可能関数 Q を surrogate cost として導入することで、確率的演算を含む勾配ベースの学習を可能にする。強化学習由来の価値関数と標準的なバックプロパゲーションを統合し、確率的ノードを通過する信用配分を可能にするとともに、決定的部品における勾配フローを維持する。多様な SCG 構造における実証的妥当性が確認された。

ABSTRACT

In real-world scenarios, it is appealing to learn a model carrying out stochastic operations internally, known as stochastic computation graphs (SCGs), rather than learning a deterministic mapping. However, standard backpropagation is not applicable to SCGs. We attempt to address this issue from the angle of cost propagation, with local surrogate costs, called Q-functions, constructed and learned for each stochastic node in an SCG. Then, the SCG can be trained based on these surrogate costs using standard backpropagation. We propose the entire framework as a solution to generalize backpropagation for SCGs, which resembles an actor-critic architecture but based on a graph. For broad applicability, we study a variety of SCG structures from one cost to multiple costs. We utilize recent advances in reinforcement learning (RL) and variational Bayes (VB), such as off-policy critic learning and unbiased-and-low-variance gradient estimation, and review them in the context of SCGs. The generalized backpropagation extends transported learning signals beyond gradients between stochastic nodes while preserving the benefit of backpropagating gradients through deterministic nodes. Experimental suggestions and concerns are listed to help design and test any specific model using this framework.

研究の動機と目的

  • 標準的なバックプロパゲーションが非微分可能な確率的演算によって失敗するため、確率的計算グラフ (SCG) における信用配分の根本的課題に対処すること。
  • 微分可能で決定論的なネットワークを超えてバックプロパゲーションを一般化し、価値ベースのフィードバックを用いて確率的ノードを越えた学習信号の伝播を可能にすること。
  • 強化学習(例:価値関数、オフポリシー学習)と変分推論(例:再パラメータライゼーション、制御変数)の知見を統合し、SCG に適用可能な単一でスケーラブルなフレームワークを構築すること。
  • 単一コストからマルチコスト構造まで、多様な SCG アーキテクチャに適用可能な柔軟でモジュール式のフレームワークを提供すること。
  • 内部に確率的構造を持つ複雑なモデルのエンドツーエンド学習を可能にするために、長時間遅延した報酬やコストを近似する局所的 surrogate cost(Q 関数)を学習すること。

提案手法

  • 各確率的ノードに学習可能な Q 関数を surrogate cost として用いる Backprop-Q フレームワークを導入し、標準的な勾配伝播をコスト伝播に置き換える。
  • 各 Q 関数をニューラルネットワーク(評価者として機能)としてパラメータライズし、確率的ノード出力からの期待リターンを推定する。このパラメータは、サンプルに基づく更新により学習される。
  • 2段階の学習プロセスを採用:まず、サンプル収益に基づくターゲットを用いて、TD(0) や TD(λ) などの演算子を用いた1ステップの SGD 更新により Q 関数パラメータを更新する。
  • 勾配推定のため、再パラメータライゼーション、連続的リラクゼーション(例:Gumbel-Softmax)および制御変数を用い、連続的および離散的確率的変数の両方における勾配の分散を低減する。
  • 学習済み Q 関数と標準的なバックプロパゲーションを統合:Q 関数の値と勾配を用いて局所的 surrogate 目的関数を構築し、元の目的関数と併せて共同最適化を行う。
  • 経験リプレイとターゲットネットワークを用いて、ポリシーに依存する学習とオフポリシー学習の両方をサポートし、複雑で非マルコフ的 SCG 構造においても Q 関数の安定した学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1標準的なバックプロパゲーションが非微分可能な確率的ノードによって失敗する確率的計算グラフにおいて、信用配分を効果的に拡張できるか?
  • RQ2価値ベースのフィードバック信号(例:Q 関数)を用いて、確率的ノードを越えて学習信号を伝播させつつ、決定的部品における勾配フローを維持できるか?
  • RQ3強化学習の技術(例:オフポリシー学習、制御変数、ターゲットネットワーク)を一般 SCG 環境で surrogate cost 関数の学習に適応できる程度はどの程度か?
  • RQ41つの SCG において複数の目的関数や重複する計算サブグラフをサポートできるように、フレームワークを一般化できるか?
  • RQ5学習可能な Q 関数を制御変数として用いることで、確率的バックプロパゲーションにおける勾配分散をどの程度低減できるか?

主な発見

  • Backprop-Q フレームワークは、局所的 Q 関数を surrogate cost として学習することで、確率的計算グラフを介したバックプロパゲーションを成功裏に実現し、確率的ノードを越えた信用配分を可能にした。
  • Q 関数を制御変数として用いることで、真のコストが遅延している、または非常に確率的である場合に、勾配分散が顕著に低減された。
  • 実証的結果から、複数の目的関数や重複するサブグラフを含む多様な SCG アーキテクチャを、アーキテクチャ制約なしにサポートすることが確認された。
  • オフポリシー Q 関数学習と標準的バックプロパゲーションを統合することで、複雑な確率的モデルにおける安定的かつ効果的な学習が可能となり、スケーラブルな最適化が実現された。
  • Backprop-Q 内部で再パラメータライゼーション、連続的リラクゼーション、制御変数を統合することで、離散的確率的変数に対してもバイアスなしで分散が小さい勾配推定器が得られた。
  • 決定論的サブグラフにおいて標準的バックプロパゲーションの効率性とスケーラビリティを維持するとともに、確率的コンポONENTS への学習信号伝播を拡張した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。