Skip to main content
QUICK REVIEW

[論文レビュー] Representations for Stable Off-Policy Reinforcement Learning

Dibya Ghosh, Marc G. Bellemare|arXiv (Cornell University)|Jul 10, 2020
Reinforcement Learning in Robotics被引用数 8
ひとこと要約

本稿では、特定の状態表現——特にシュール分解と直交的クライフ基底——が、遷移行列の幾何構造を尊重することで、オフポリシー時系列差分学習における安定性を保証すると提案している。これらの表現は、将来の特徴量や報酬を予測する補助タスクにおける確率的勾配降下法を用いて学習可能であり、近似品質を損なわずに形式的な安定性保証を達成できる。

ABSTRACT

Reinforcement learning with function approximation can be unstable and even divergent, especially when combined with off-policy learning and Bellman updates. In deep reinforcement learning, these issues have been dealt with empirically by adapting and regularizing the representation, in particular with auxiliary tasks. This suggests that representation learning may provide a means to guarantee stability. In this paper, we formally show that there are indeed nontrivial state representations under which the canonical TD algorithm is stable, even when learning off-policy. We analyze representation learning schemes that are based on the transition matrix of a policy, such as proto-value functions, along three axes: approximation error, stability, and ease of estimation. In the most general case, we show that a Schur basis provides convergence guarantees, but is difficult to estimate from samples. For a fixed reward function, we find that an orthogonal basis of the corresponding Krylov subspace is an even better choice. We conclude by empirically demonstrating that these stable representations can be learned using stochastic gradient descent, opening the door to improved techniques for representation learning with deep networks.

研究の動機と目的

  • 関数近似を伴うオフポリシーTD学習における不安定性を解消すること。特に深層強化学習における課題に焦点を当てる。
  • 関数近似を伴うオフポリシー設定下でTD(0)の収束を保証する状態表現を形式的に特徴づけること。
  • 遷移ダイナミクスの行列幾何学を介して表現学習と価値関数アルゴリズムの安定性を結びつけること。
  • 将来の特徴量や報酬を予測するような補助タスクが、形式的に安定な表現をもたらす可能性があることを示すこと。
  • このような安定な表現が、深層ネットワークにおける確率的勾配降下法を用いて学習可能であることを示すこと。

提案手法

  • 価値関数更新の期待的ダイナミクスに注目し、表現の幾何構造に着目することでTD(0)の安定性を分析する。
  • オフポリシーデータ下でも安定性をもたらす遷移行列のシュール分解を特定する。
  • 報酬関数が既知である場合に、直交的クライフ基底を安定な代替表現として提案する。
  • 次のステップの特徴量値を予測するとシュールに基づく表現が得られ、将来の報酬を予測するとクライフに基づく表現が得られることを示す。
  • 神経ネットワークにおけるこれらの表現を、補助目的関数を用いた確率的勾配降下法で学習する。
  • 直交性制約またはペナルティを用いて特徴量の無相関性を保証し、安定性保証を維持する。

実験結果

リサーチクエスチョン

  • RQ1関数近似を伴うオフポリシー学習下で、どの状態表現がTD(0)の収束を保証するか?
  • RQ2遷移行列の幾何構造は、価値関数学習の安定性にどのように影響するか?
  • RQ3補助的表現学習タスクは、オフポリシー強化学習における形式的安定表現をもたらすことができるか?
  • RQ4深層ニューラルネットワークを用いて、データから安定な表現をどの程度学習可能か?
  • RQ5オフポリシー強化学習における表現学習において、安定性、近似誤差、学習可能性の間にはどのようなトレードオフがあるか?

主な発見

  • 一般の場合でも、遷移行列のシュール分解は、オフポリシー学習下でTD(0)の形式的収束保証を提供する。
  • 報酬関数から導かれる直交的クライフ基底は、プロト値関数よりもより安定的かつ高精度な代替表現を提供する。
  • 非対称行列における摂動に敏感であるため、シュール表現の推定は他の分解よりも困難である。
  • 実際の応用では、クライフ基底はシュール分解よりも近似誤差が小さく、学習可能性も優れているが、報酬関数の事前知識を必要とする。
  • 将来の特徴量値(シュール)や将来の報酬(クライフ)を予測するタスクは、SGDによる安定な表現学習を可能にする効果的な補助タスクである。
  • 神経ネットワークは、これらの予測的補助目的関数を最適化することで、安定な表現を効果的に学習可能であり、本手法の実用的妥当性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。