Skip to main content
QUICK REVIEW

[論文レビュー] Deep RL With Information Constrained Policies: Generalization in Continuous Control

Tyler Malloy, Chris R. Sims|arXiv (Cornell University)|Oct 9, 2020
Reinforcement Learning in Robotics参考文献 14被引用数 5
ひとこと要約

本稿では、連続的制御タスクにおける一般化性能の向上を図るために、相互情報量正則化を用いてポリシーの複雑さに情報理論的制約を課すことで、情報処理能力に制限のある強化学習アルゴリズムであるCapacity-Limited Actor-Critic(CLAC)を提案する。ポリシー学習をレート・リダクション問題として形式化することにより、CLACはSACやMIRLよりも優れた分布外一般化性能を達成するとともに、高いサンプル効率を維持する。

ABSTRACT

Biological agents learn and act intelligently in spite of a highly limited capacity to process and store information. Many real-world problems involve continuous control, which represents a difficult task for artificial intelligence agents. In this paper we explore the potential learning advantages a natural constraint on information flow might confer onto artificial agents in continuous control tasks. We focus on the model-free reinforcement learning (RL) setting and formalize our approach in terms of an information-theoretic constraint on the complexity of learned policies. We show that our approach emerges in a principled fashion from the application of rate-distortion theory. We implement a novel Capacity-Limited Actor-Critic (CLAC) algorithm and situate it within a broader family of RL algorithms such as the Soft Actor Critic (SAC) and Mutual Information Reinforcement Learning (MIRL) algorithm. Our experiments using continuous control tasks show that compared to alternative approaches, CLAC offers improvements in generalization between training and modified test environments. This is achieved in the CLAC model while displaying the high sample efficiency of similar methods.

研究の動機と目的

  • 有限な情報処理能力を持つエージェントをモデル化することで、連続的制御のための深層強化学習における一般化性能の向上を図ること。
  • ポリシー学習をレート・リダクション最適化問題として形式化し、生物学的認知と情報理論に接続すること。
  • 相互情報量正則化を通じてパフォーマンスと一般化のバランスを取る、新たなアルゴリズムCLACを開発すること。
  • 情報容量制限付きポリシーが、標準的なエントロピー正則化法や相互情報量正則化法よりも優れた一般化性能を示すことを実証すること。
  • 報酬スケールの変動に強い性能を維持し、負の転送の低減を図るために、相互情報量係数の自動調整を可能にすること。

提案手法

  • 強化学習の目的関数を、ポリシーの相互情報量が最大容量Cに制限されるレート・リダクション問題として形式化する。
  • ポリシー・チャネルπ(a|s)における相互情報量制約のもとで期待報酬を最大化する学習目的関数を導出する。
  • 相互情報量正則化項−β·I(π(a|s))を導入した、深層オフポリシーのアクタ・クリティック法であるCLACアルゴリズムを提案する。
  • SACのα調整にインspiredされた自動β係数更新ルールを採用し、学習中に情報容量を動的に制御可能にする。
  • クリティックネットワークを用いた変分近似により、状態と行動間の相互情報量を推定する。
  • N-chainやMuJoCoベンチマークを含む連続的制御環境に本手法を適用し、一般化性能を摂動付きのテスト条件下で評価する。

実験結果

リサーチクエスチョン

  • RQ1相互情報量によるポリシー複雑さの制約が、連続的制御RLにおける一般化性能の向上に寄与するか?
  • RQ2情報制約付きポリシー学習は、エントロピー正則化(SAC)や相互情報量正則化(MIRL)法と比較して、分布外一般化性能で優れているか?
  • RQ3相互情報量係数の自動調整が、環境間で安定した性能とロバストネスを向上させるか?
  • RQ4レート・リダクションにインspiredされた目的関数は、標準的な深層RLベースラインと比較して、より高いサンプル効率と一般化性能を達成できるか?
  • RQ5情報容量制限が、転移学習シナリオにおける負の転送をどれほど低減できるか?

主な発見

  • CLACは、摂動を加えた連続的制御環境において、SACやMIRLよりも優れた一般化性能を示す。特に分布外設定で顕著な優位性を示す。
  • 自動β調整メカニズムにより、訓練の安定化と報酬スケールの変動に対するロバストネスが向上し、SACのα適応と同様の効果を発揮する。
  • CLACはベースライン手法よりも高いサンプル効率を達成するとともに、強力な一般化性能を維持する。
  • 情報理論的制約により、ポリシーの複雑さが効果的に制限され、特定の状態-行動パターンへの過学習が抑制される。
  • CLACは、標準的な転移学習と比較して負の転送が低減しており、タイトな情報制約により、劣悪なポリシーの再利用が防がれる。
  • 実験結果から、環境パラメータが変更された場合にCLACはMERLベース手法よりも優れた一般化性能を示すことが確認され、容量制限付き学習の利点が裏付けられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。