Skip to main content
QUICK REVIEW

[論文レビュー] Temporal Difference Learning with Neural Networks - Study of the Leakage Propagation Problem

Hugo Penedones, Damien Vincent|arXiv (Cornell University)|Jul 9, 2018
Reinforcement Learning in Robotics参考文献 22被引用数 5
ひとこと要約

この論文は、ニューラルネットワークを用いた時系列差分(TD)学習における漏れ伝播のメカニズムを調査している。特に、価値関数の急峻な不連続性付近における近似誤差が伝播し、性能を劣化させる現象に注目している。理論的・実験的に、TD学習はブートストラップに起因する誤差拡散のため、モンテカルロ回帰よりも悪い解に収束することがあり、これを補うために報酬なしで成功者特徴の教師なし学習を用いる手法を提案している。

ABSTRACT

Temporal-Difference learning (TD) [Sutton, 1988] with function approximation can converge to solutions that are worse than those obtained by Monte-Carlo regression, even in the simple case of on-policy evaluation. To increase our understanding of the problem, we investigate the issue of approximation errors in areas of sharp discontinuities of the value function being further propagated by bootstrap updates. We show empirical evidence of this leakage propagation, and show analytically that it must occur, in a simple Markov chain, when function approximation errors are present. For reversible policies, the result can be interpreted as the tension between two terms of the loss function that TD minimises, as recently described by [Ollivier, 2018]. We show that the upper bounds from [Tsitsiklis and Van Roy, 1997] hold, but they do not imply that leakage propagation occurs and under what conditions. Finally, we test whether the problem could be mitigated with a better state representation, and whether it can be learned in an unsupervised manner, without rewards or privileged information.

研究の動機と目的

  • 関数近似を伴うTD学習が、オンポリシー評価においてモンテカルロ回帰よりも悪い解に収束する理由を理解すること。
  • 価値関数の急峻な不連続性付近における不良近似から生じる誤差伝播(「漏れ伝播」と呼ばれる)のメカニズムを解明すること。
  • 報酬なしに学習されたより良い状態表現が、この病理を緩和できるかどうかを評価すること。
  • 教師なし表現学習が、TD誤差伝播を軽減し、推定精度を向上させられるかどうかを調査すること。

提案手法

  • 単純な可逆マルコフ連鎖を分析し、関数近似下での漏れ伝播を形式的に示す。
  • TD損失関数におけるトレードオフを表現するため、ディリクレ型とユークリッドノルムの混合を用いる。
  • モンテカルロ回帰を用いて事前学習した成功者特徴を状態表現として用い、TD学習に組み込むことで誤差伝播を回避する。
  • 軌道のトポロジーに基づく教師なし補助損失を導入し、見かけ上類似した状態を区別できる表現を学習する。
  • 2次元ナビゲーション環境で、急峻な不連続性を有する設定において、改善された表現を用いた/使わないTD学習を比較する。
  • 即時の報酬と次の観測値を予測するタスクを補助タスクとして用いる表現学習の設定を採用する。

実験結果

リサーチクエスチョン

  • RQ1なぜ関数近似を伴うTD学習は、オンポリシー評価においてもモンテカルロ回帰よりも悪い解に収束することがあるのか?
  • RQ2価値関数の急峻な不連続性付近での近似誤差が、どのような条件下でTD推定値を劣化させる形で伝播するのか?
  • RQ3教師なし表現学習により、このような不連続性が存在する状況下でもTD価値関数推定の精度を向上させられるか?
  • RQ4報酬を用いずに、軌道のトポロジカル構造を捉えた状態表現を学習することは可能か?

主な発見

  • 関数近似誤差が価値関数の急峻な不連続性付近に存在する場合、単純な可逆MDPでさえTD学習において漏れ伝播が発生する。
  • 問題は、Ollivier(2018)が指摘したTD損失関数内の2つの項のトレードオフに起因し、TsitsiklisとVan Roy(1997)の一般化バインディングではカバーされない。
  • 特権的な知識を有する表現(例:成功者特徴)は、推定誤差を顕著に低減し、漏れ伝播を緩和できる。
  • 即時の報酬と次の観測値を予測する補助タスクに基づく教師なし表現学習は、2次元ナビゲーションタスクにおいて性能向上をもたらし、誤差伝播を低減する。
  • TD学習を実行する前にモンテカルロ回帰で成功者特徴を事前学習する手法は、生の状態上で直接TD学習を実行するよりも、より正確な価値関数推定を実現する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。