Skip to main content
QUICK REVIEW

[論文レビュー] On the Generalization Gap in Reparameterizable Reinforcement Learning

Huan Wang, Stephan Zheng|arXiv (Cornell University)|May 29, 2019
Reinforcement Learning in Robotics被引用数 14
ひとこと要約

本稿は、再パrameter化可能強化学習のための理論的一般化バウンドを確立し、再パラメータライゼーショントリックを介して監視学習にリンクさせることで、RademacherおよびPAC-Bayes解析を可能にした。一般化ギャップが環境遷移、報酬、方策関数クラスの滑らかさに依存することを示し、滑らかさの高いダイナミクスと低いリプシッツ定数の下でギャップが小さくなることを実験的に検証した。

ABSTRACT

Understanding generalization in reinforcement learning (RL) is a significant challenge, as many common assumptions of traditional supervised learning theory do not apply. We focus on the special class of reparameterizable RL problems, where the trajectory distribution can be decomposed using the reparametrization trick. For this problem class, estimating the expected return is efficient and the trajectory can be computed deterministically given peripheral random variables, which enables us to study reparametrizable RL using supervised learning and transfer learning theory. Through these relationships, we derive guarantees on the gap between the expected and empirical return for both intrinsic and external errors, based on Rademacher complexity as well as the PAC-Bayes bound. Our bound suggests the generalization capability of reparameterizable RL is related to multiple factors including "smoothness" of the environment transition, reward and agent policy function class. We also empirically verify the relationship between the generalization gap and these factors through simulations.

研究の動機と目的

  • 方策学習における有限標本一般化保証の欠如、特に過学習および分布シフトの問題に対処する。
  • 軌道分布を再パラメータライゼーショントリックを用いて分離可能な再パラメータライズ可能RL問題のクラスを同定し、理論的解析を可能にする。
  • Rademacher複雑度およびPAC-Bayes理論を用いて、内在的(過学習に類似)および外在的(分布シフト)誤差の両方の一般化バウンドを導出する。
  • 勾配最適化を用いて、方策の滑らかさ(ソフトマックスの温度により制御)、遷移の滑らかさ、およびモデルサイズを変化させた際の一般化ギャップを実験的に評価する。

提案手法

  • 再パラメータライゼーショントリックを用いて、軌道を周辺的な確率的変数の決定的関数として表現し、方策の依存性と環境のランダムネスを分離する。
  • Rademacher複雑度およびPAC-Bayesバウンドを適用し、再パラメータライズ可能MDPにおける期待報酬と経験的報酬の有限標本一般化保証を導出する。
  • 方策および環境ダイナミクスを有界なリプシッツ定数を持つ関数クラスとしてモデル化し、重みノルムを滑らかさの代理として用いる。
  • 確率的勾配最適化を用いて、方策の滑らかさ(ソフトマックスの温度)、遷移の滑らかさ、およびモデルサイズを変化させた際の一般化ギャップを実験的に評価する。
  • 初期状態および遷移分布に制御された摂動(Rademacherノイズを用いて)を加え、分布シフト下での外部一般化ギャップを測定する。
  • Adam最適化手法を用い、学習率を段階的に減少させ、各設定について100回の試行を実施して統計的安定性を確保する。

実験結果

リサーチクエスチョン

  • RQ1標準的な監視学習の仮定が成り立たない場合、方策学習における一般化をどのように理論的に分析できるか?
  • RQ2再パラメータライズ可能RLにおいて、一般化ギャップと方策、環境遷移、報酬関数の滑らかさの関係は何か?
  • RQ3Rademacher複雑度およびPAC-Bayesバウンドは、再パラメータライズ可能RLにおける有限標本一般化保証を効果的に導出可能か?
  • RQ4初期状態または遷移ダイナミクスにおける分布シフトが、RLにおける一般化ギャップにどのように影響し、そのギャップをバウンドできるか?
  • RQ5モデル容量および最適化ハイパーパramータは、再パラメータライズ可能RLにおける一般化ギャップにどの程度影響を及ぼすか?

主な発見

  • 方策が滑らかになるにつれて一般化ギャップが減少し、方策のリプシッツ定数メトリック(1/τ ∏‖θˡ‖F)が65.6kから131.3kに増加する際、平均ギャップが20%低下した。
  • 初期化ノイズスケールζを1から10に増加させると、平均一般化ギャップが0.481から0.477に低下し、滑らかな方策では初期状態シフトに対する感度が低下することが示された。
  • 遷移分布のシフトが一般化ギャップを著しく増大させる:ζを1から1,000に増加させると、ギャップが11から73,300に増加し、時間ステップにわたる誤差の蓄積が顕著に観察された。
  • 温度τを用いて遷移の滑らかさ(T₁)を向上させると、τを1から100に増加させた際、一般化ギャップが0.336から0.214に低下し、滑らかさが一般化誤差を低減する役割を果たすことが確認された。
  • より大きなモデルでは一般化ギャップが高くなる:モデルパラメータを65.6kから110万に増加させると、ギャップは0.204から0.418に上昇し、再パラメータライズ可能設定においても容量が過学習を悪化させる可能性があることが示唆された。
  • 実験結果は、一般化性能が特に分布シフト下で、方策および環境ダイナミクスの滑らかさに強く依存することを理論的主張と一致させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。