Skip to main content
QUICK REVIEW

[論文レビュー] PEORL: Integrating Symbolic Planning and Hierarchical Reinforcement Learning for Robust Decision-Making

Fangkai Yang, Daoming Lyu|arXiv (Cornell University)|Apr 20, 2018
Reinforcement Learning in Robotics参考文献 19被引用数 19
ひとこと要約

本稿では、不確実な環境における頑健な意思決定を可能にするために、記号的計画と階層強化学習(HRL)を統合するフレームワークPEORLを提案する。反復的に記号的計画を用いてHRLをガイドし、学習済みオプションを介して、経験をフィードバックして計画を精錬することで、PEORLは方策学習を加速させ、計画の頑健性を向上させる。TaxiおよびGridworldベンチマークにおいて、単独のRL、HRL、計画エージェントを上回り、累積報酬が高く、実行障害が少ない。

ABSTRACT

Reinforcement learning and symbolic planning have both been used to build intelligent autonomous agents. Reinforcement learning relies on learning from interactions with real world, which often requires an unfeasibly large amount of experience. Symbolic planning relies on manually crafted symbolic knowledge, which may not be robust to domain uncertainties and changes. In this paper we present a unified framework {\em PEORL} that integrates symbolic planning with hierarchical reinforcement learning (HRL) to cope with decision-making in a dynamic environment with uncertainties. Symbolic plans are used to guide the agent's task execution and learning, and the learned experience is fed back to symbolic knowledge to improve planning. This method leads to rapid policy search and robust symbolic plans in complex domains. The framework is tested on benchmark domains of HRL.

研究の動機と目的

  • 純粋な強化学習(RL)が膨大な経験を必要とすること、および記号的計画がドメインの不確実性に対して頑健でないことの限界を解消すること。
  • RLからの経験を用いて、静的である傾向のある記号的計画を動的に改善することにより、その静的性を克服すること。
  • 事前に定義されたまたはヒューリスティックなオプションに依存せず、記号的計画を用いてHRLにおけるオプションの自動発見を可能にすること。
  • 特に実行障害や不確実なドメイン詳細の処理において、RLから得た学習知識を統合することで、記号的計画の頑健性を高めること。
  • 計画とHRLの間の双方向フィードバックループを構築し、方策のパフォーマンスと計画の質の両方を向上させること。

提案手法

  • ドメインのダイナミクスを形式的にモデル化できるように、行動言語${\cal BC}$を用いて行動と制約の常識的知識を表現する。
  • 制約答え集合ソルバ(Clingcon)が初期状態と目的から記号的計画を生成し、それがHRL用の確率的オプションの決定的シーケンスにマッピングされる。
  • 階層的R学習が採用され、方策学習をガイドするための2つの値を最適化する:平均補正報酬$R$と累積平均報酬(ゲイン報酬)$\rho$。
  • ゲイン報酬$\rho$が、Clingconによる記号的計画の改善にフィードバック信号として用いられ、反復的精錬を通じて高品質な計画の発見が可能になる。
  • このプロセスは反復的である:改善された記号的計画が新たなオプションを生成し、それがさらにRLをガイドする。これにより、より良い計画が得られなくなるまで繰り返される。
  • 学習経験に基づいて新しいオプションや計画が出現可能であるため、事前に指定されたオプションに依存しない動的適応が可能である。

実験結果

リサーチクエスチョン

  • RQ1記号的計画を用いて、複雑な環境における方策探索を加速できるか?
  • RQ2強化学習からのフィードバックは、ドメインの不確実性や実行障害の存在下で、記号的計画の頑健性と品質を向上させられるか?
  • RQ3手動でコーディングされたまたはヒューリスティックなオプションに依存せず、記号的計画を用いてHRLにおける意味のあるオプションを自動的に発見できるか?
  • RQ4計画と学習の双方向統合は、単独のRLまたは計画エージェントと比較して、累積報酬と計画の信頼性にどのような影響を与えるか?
  • RQ5強化学習から得た学習経験を、高コストの障害を回避するか、隠れた報酬を活用する計画を生成するために、どの程度活用できるか?

主な発見

  • Taxiドメインでは、PEORLエージェントは、RLエージェントや計画エージェントが発見できなかった報酬が追加で得られる状態(4,4)を発見し、累積報酬が著しく向上した。
  • PEORLエージェントは、累積報酬においてRLエージェントおよびHRLエージェントを上回り、収束が早く、学習曲線のばらつきも小さい。
  • Gridworldドメインでは、PEORLエージェントはバンパーを確実に回避し、プッシュ行動を正常に実行することで最適な行動を示し、報酬と一貫性の両面でRLエージェントを上回った。
  • PEORLエージェントは、学習知識を活用して計画の頑健性を向上させることで、実行障害を低減したが、計画のみのエージェント(Pエージェント)は学習能力に欠けるため、高い障害率を示した。
  • 記号的計画とR学習の間の反復的フィードバックループにより、初期の記号的知識に含まれていない新しい高価値の状態や行動が発見され、適応性が向上した。
  • 本フレームワークは、R学習を介して記号的計画とHRLを統合することで、隠れた報酬や不確実なダイナミクスを有するドメインにおいて、より頑健で効率的な意思決定が可能になることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。