Skip to main content
QUICK REVIEW

[論文レビュー] Towards an Interpretable Hierarchical Agent Framework using Semantic Goals

Bharat Prakash, Nicholas R. Waytowich|arXiv (Cornell University)|Oct 16, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本論文は、高レベルのタスク分解にシンボリックプランナを組み合わせ、解釈可能な意味的ゴール(空間的および触覚的述語によって定義される)に条件付けられた低レベルポリシーを用いる階層的強化学習フレームワークを提案する。これにより、長時間スパンのロボット操作タスクにおけるサンプル効率の学習が可能になる。このフレームワークは、複数のブロック操作タスクにおいて、密度型およびスパarsity型報酬ベースラインを上回り、すべての評価環境で100%のタスク成功を達成した。これは、解釈性の向上と人間によるフィードバック・適応性の向上によるものである。

ABSTRACT

Learning to solve long horizon temporally extended tasks with reinforcement learning has been a challenge for several years now. We believe that it is important to leverage both the hierarchical structure of complex tasks and to use expert supervision whenever possible to solve such tasks. This work introduces an interpretable hierarchical agent framework by combining planning and semantic goal directed reinforcement learning. We assume access to certain spatial and haptic predicates and construct a simple and powerful semantic goal space. These semantic goal representations are more interpretable, making expert supervision and intervention easier. They also eliminate the need to write complex, dense reward functions thereby reducing human engineering effort. We evaluate our framework on a robotic block manipulation task and show that it performs better than other methods, including both sparse and dense reward functions. We also suggest some next steps and discuss how this framework makes interaction and collaboration with humans easier.

研究の動機と目的

  • 長時間スパンのロボット操作タスクにおける強化学習のサンプル非効率性と解釈性の低さという課題に対処すること。
  • 人間が理解しやすい意味的述語を活用することで、複雑で手作業によるカスタマイズが必要な密度型報酬関数への依存を減らすこと。
  • シンボリックプランニングによる高レベル計画と部分ゴールの解釈可能性のおかげで、人間による干渉と協働を可能にすること。
  • ドメイン固有の述語を用いたタスクの階層的構造化によって、ロボット制御の一般化性と安全性を向上させること。
  • モジュール型の階層的エージェントアーキテクチャを用いて、複雑で時間的に延長された操作タスクにおける実現可能性とサンプル効率を示すこと。

提案手法

  • フレームワークは、初期状態と目的状態から部分ゴールのシーケンスを生成する高レベルポリシーとして、シンボリックなSTRIPSプランナを用いる。
  • 低レベルポリシーは、ゴール条件付き強化学習を用いて学習され、ゴールは「close」、「above」、「holding」、「in-bin」などの意味的述語によって指定される。
  • 空間的および触覚的述語から得られるドメイン知識に基づき、意味的ゴール表現を構築することで、ゴール指定の簡素化と解釈性の向上を図る。
  • プランナの出力がシンボリック的かつ解釈可能であるため、人間による高レベル計画の変更(部分ゴールの追加や再順序化)が可能である。
  • 学習の安定性とサンプル効率を向上させるために、カリキュラムベースのアプローチを用いて部分ゴールをキュレートする。
  • フレームワークは3つの環境で評価された:2ブロック、3ブロック、デスク片付けタスク。各環境には複数の高レベルタスクが含まれる。

実験結果

リサーチクエスチョン

  • RQ1意味的ゴール表現を用いた階層的エージェントフレームワークは、密度型およびスパarsity型報酬ベースラインと比較して、長時間スパンのロボット操作タスクにおけるサンプル効率を向上させることができるか?
  • RQ2解釈可能な述語を用いたシンボリックプランニングの使用は、タスク計画プロセスにおける人間の理解と干渉をどのように向上させるか?
  • RQ3複雑な報酬形状の調整を必要とせずに、多様な操作タスクに一般化できる範囲はどの程度か?
  • RQ4複数のエージェントや人間が部分タスクを分担して実行できるように、このフレームワークは支援できるか?
  • RQ5意味的ゴール空間の解釈可能性は、現実世界のロボットタスクにおけるポリシー行動と安全性にどのように影響を与えるか?

主な発見

  • 提案されたフレームワークは、2ブロック、3ブロック、デスク片付け環境の全8つの高レベルタスクにおいて100%のタスク成功を達成し、すべてのベースラインを上回った。
  • フラットな意味的ベースラインは「ブロックを離す」タスクでは成功したが、テーブルからブロックを倒す攻撃的で危険なポリシーを学習した。一方、提案手法はより穏やかで安全なポリシーを学習した。
  • すべてのベースライン(密度型報酬関数を含む)は、500万ステップの学習後でもタスクを解消できず、意味的ゴールに基づくアプローチの優位性が示された。
  • 意味的述語の使用により、密度型報酬関数の必要性が排除され、人的な工学的作業の負荷が著しく削減された。
  • シンボリックプランナのおかげで、計画の簡単な人間による点検と修正が可能になり、協働と干渉を促進した。
  • フレームワークは複雑で時間的に延長されたタスクにおいて、頑健性とサンプル効率を示し、現実世界への展開に強く有望であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。