Skip to main content
QUICK REVIEW

[論文レビュー] Predictive Coding for Boosting Deep Reinforcement Learning with Sparse Rewards

Xingyu Lu, Stas Tiomkin|arXiv (Cornell University)|Dec 21, 2019
Reinforcement Learning in Robotics参考文献 32被引用数 4
ひとこと要約

本論文では、スパarsity rewardを伴う深層強化学習における報酬の形状を、予測符号化を用いて教師なし表現を学習することで提案する。対照的予測符号化(CPC)を用いて軌道内の連続する状態間の相互情報量を最大化することで、ノイズに強く、ダイナミクスに敏感な報酬信号を生成し、ロボットの操作、ナビゲーション、歩行タスクにおいて、手作業で設計された報酬と同等のサンプル効率を達成する。

ABSTRACT

While recent progress in deep reinforcement learning has enabled robots to learn complex behaviors, tasks with long horizons and sparse rewards remain an ongoing challenge. In this work, we propose an effective reward shaping method through predictive coding to tackle sparse reward problems. By learning predictive representations offline and using these representations for reward shaping, we gain access to reward signals that understand the structure and dynamics of the environment. In particular, our method achieves better learning by providing reward signals that 1) understand environment dynamics 2) emphasize on features most useful for learning 3) resist noise in learned representations through reward accumulation. We demonstrate the usefulness of this approach in different domains ranging from robotic manipulation to navigation, and we show that reward signals produced through predictive coding are as effective for learning as hand-crafted rewards.

研究の動機と目的

  • スパarsity報酬を伴う深層強化学習におけるサンプル非効率性の課題に対処すること。
  • ドメイン特化の報酬設計を必要とせず、教師なし表現学習を活用した報酬形状化手法を開発すること。
  • 学習された表現におけるノイズに強く、環境のダイナミクスに焦点を当てる報酬信号を生成すること。
  • 予測符号化に基づく報酬形状化が、複雑な制御タスクにおいて手作業で設計された報酬と同等の性能を示すことを実証すること。

提案手法

  • 本手法は、軌道内の連続する状態間の相互情報量を最大化するように、対照的予測符号化(CPC)を用いて表現を学習する。
  • 予測特徴は、ランダムまたは探索的方策によって収集されたオフラインの軌道から抽出される。
  • これらの特徴は、表現空間における報酬形状化に用いられ、エージェントが生の観測値から学習する際の密集したフィードバックを提供する。
  • 報酬形状化は、密な、スパarsity報酬に依存しない信号として適用され、表現学習とポリシー学習が分離される。
  • PPOなどの標準的な深層強化学習アルゴリズムと互換性があり、2段階のパイプラインとして動作する:オフラインのエンコーダー事前学習、その後に報酬形状化を施したオンラインRL。
  • ノイズ耐性は、埋め込みを直接特徴として使用せず、むしろそれらを報酬形状化にのみ使用することで向上し、不完全な表現への感受性が低減される。

実験結果

リサーチクエスチョン

  • RQ1教師なしの予測符号化表現は、スパarsity報酬を伴う強化学習において効果的な報酬信号を提供できるか?
  • RQ2予測符号化に基づく報酬形状化は、サンプル効率および最終的なパフォーマンスの観点で、手作業で設計された報酬と比べてどうか?
  • RQ3明示的な教師なしでない条件下でも、予測符号化表現は異なるテクスチャや環境変動に一般化可能か?
  • RQ4報酬形状化に予測特徴を使用することは、ポリシー学習における状態特徴として使用する場合を上回るか?
  • RQ5長時間スパンでかつ探索が限られた環境では、この手法はどのように性能を示すか?

主な発見

  • 提案手法は、ロボット操作、ナビゲーション、歩行タスクにおいて、手作業で設計された報酬と同等の性能を達成し、サンプル効率が同等であることを示した。
  • 予測符号化特徴を報酬形状化に使用することは、特にノイズが多い、または未熟な表現の状態において、それらを状態特徴として使用する場合を著しく上回った。
  • 背景のテクスチャ変動に対して耐性を示し、埋め込みが物理的状態(例:アームの角度)に応じてクラスタリングされるなど、ダイナミクスの有効な抽象化がなされていることが示された。
  • 予測符号化による報酬形状化により、限られた探索が可能な環境でも安定した学習が可能となり、Reacher や Pendulum のような環境では、標準的なスパarsity報酬学習を上回った。
  • 表現学習とポリシー学習を分離することで、表現のノイズに敏感な感度が低下し、軌道全体にわたる報酬の蓄積を活用した。
  • 本手法は、ピクセル入力などの高次元観測値を伴う多様な環境においても、アーキテクチャ的・アルゴリズム的変更なしに有効であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。