Skip to main content
QUICK REVIEW

[論文レビュー] What Should I Do Now? Marrying Reinforcement Learning and Symbolic Planning

Daniel Gordon, Dieter Fox|arXiv (Cornell University)|Jan 6, 2019
Reinforcement Learning in Robotics参考文献 35被引用数 13
ひとこと要約

この論文は、視覚的意思決定の長期的課題を改善するために、シンボリック計画とディープ強化学習を統合するフレームワークであるHierarchical Planning and Reinforcement Learning (HIP-RL)を紹介している。計画者が効率的な行動シーケンスを生成し、メタコントローラーが低レベルのポリシーを起動することで、HIP-RLはインタラクティブな質疑応答と視覚的意味的計画タスクにおいて最先端の性能を達成し、純粋なRLベースラインと比較してテスト時のステップ数と学習イテレーション回数を1桁減少させた。

ABSTRACT

Long-term planning poses a major difficulty to many reinforcement learning algorithms. This problem becomes even more pronounced in dynamic visual environments. In this work we propose Hierarchical Planning and Reinforcement Learning (HIP-RL), a method for merging the benefits and capabilities of Symbolic Planning with the learning abilities of Deep Reinforcement Learning. We apply HIPRL to the complex visual tasks of interactive question answering and visual semantic planning and achieve state-of-the-art results on three challenging datasets all while taking fewer steps at test time and training in fewer iterations. Sample results can be found at youtu.be/0TtWJ_0mPfI

研究の動機と目的

  • ディープ強化学習が疎な報酬と指数関数的に増大する状態空間のため困難となる動的視覚環境における長期的計画の課題に対処すること。
  • 純粋なシンボリック計画の限界、すなわち正確な状態推定を必要とし、直接的に生の視覚入力を処理できないことの克服。
  • ディープラーニングの特徴抽出能力とシンボリック計画の構造的・目的指向の推論を組み合わせ、より高いサンプル効率とテスト時のパフォーマンスを向上させること。
  • 複雑な視覚的推論タスクにおいて、正確性を維持または向上させながら、学習時間とテスト時のステップ数を削減すること。
  • 一貫性があり構造的な行動を実現する計画の活用により、未観測の環境への一般化を向上させること。

提案手法

  • HIP-RLは、メタコントローラーが高レベルの行動を選択し、計画者に低レベル行動のシーケンスを生成させる階層的アーキテクチャを採用している。
  • 計画者は、オブジェクト検出の出力から得られるシンボリック状態表現に基づいて、完全で実行可能な計画をメトリックFFを用いて生成する。
  • オブジェクト検出(例:Mask-RCNN)が計画者の入力としてのシンボリック状態を提供し、オブジェクトの位置やアフォーダンスについて推論可能にする。
  • メタコントローラーは、タスク完了による疎な報酬を用いて、ディープ強化学習により計画の起動と低レベルポリシーの実行を学習する。
  • 探索(反応的ポリシーを介して)と計画(シンボリック推論を介して)を交互に実行することで、効率性と完全性のバランスを取る。
  • 新しい観測が得られた際には計画者を再起動し、環境の変化に応じた動的計画の更新を可能にする。

実験結果

リサーチクエスチョン

  • RQ1シンボリック計画は、長期的視覚タスクにおけるディープ強化学習のサンプル効率とテスト時のパフォーマンスを向上させ得るか?
  • RQ2計画と学習を組み合わせることで、未観測の環境への一般化性能はどのように変化するか?
  • RQ3階層的フレームワークは、推論時のステップ数を削減しつつ、正確性を維持または向上させ得るか?
  • RQ4学習されたメタコントローラーは、反応的ポリシーとシンボリック計画者を効果的に統合できるか?
  • RQ5計画の使用は、質問応答タスクの初期学習段階における矛盾する学習信号の問題をどの程度緩和できるか?

主な発見

  • HIP-RLはIQUAD V1およびEQA V1で最先端のパフォーマンスを達成し、精度とサンプル効率の両面で先行手法を上回った。
  • IQUAD V1では、HIP-RLは120,000の階層的ステップで最大性能に収束したが、HIMNは500,000ステップを要し、顕著に低いパフォーマンスに留まった。
  • 真値検出を用いた場合、HIP-RLはわずか26,000の階層的ステップでHIMNの最終パフォーマンスに達し、学習速度が10倍向上したことを示した。
  • HIP-RLは、冗長な探索を回避することでテスト時のステップ数を削減した。視覚的意味的計画タスクでは、マイクロ波調理器が検出され次第、直ちに使用された。
  • 未観測の部屋への一般化性能は高く、真値検出を用いた場合、IQUAD V1およびVSPにおいて性能低下は10%未満にとどまったが、レアオブジェクトクラスの学習データが限られていたにもかかわらず。
  • Mask-RCNNの検出結果を用いた場合、性能は依然として妥当であったが、珍しいまたは未観測のキャビネットや引き出しの検出失敗により、未観測環境での性能ギャップが顕著に現れた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。