Skip to main content
QUICK REVIEW

[論文レビュー] Value Function Spaces: Skill-Centric State Abstractions for Long-Horizon Reasoning

Dhruv Shah, Peng Xu|arXiv (Cornell University)|Nov 4, 2021
Reinforcement Learning in Robotics被引用数 9
ひとこと要約

本稿では、価値関数を用いて低レベルのスキルの特徴を統合することで、環境のコンパクトで不変な表現を生成するスキル中心の状態抽象化である価値関数空間(VFS)を提案する。状態をスキルの機能的特徴に基づいて符号化することにより、VFSは長時間スパンの強化学習の性能を向上させ、顕著なゼロショット一般化を実現し、迷路解法およびロボット操作タスクにおいて対照的・情報理論的アプローチを上回る性能を示す。

ABSTRACT

Reinforcement learning can train policies that effectively perform complex tasks. However for long-horizon tasks, the performance of these methods degrades with horizon, often necessitating reasoning over and chaining lower-level skills. Hierarchical reinforcement learning aims to enable this by providing a bank of low-level skills as action abstractions. Hierarchies can further improve on this by abstracting the space states as well. We posit that a suitable state abstraction should depend on the capabilities of the available lower-level policies. We propose Value Function Spaces: a simple approach that produces such a representation by using the value functions corresponding to each lower-level skill. These value functions capture the affordances of the scene, thus forming a representation that compactly abstracts task relevant information and robustly ignores distractors. Empirical evaluations for maze-solving and robotic manipulation tasks demonstrate that our approach improves long-horizon performance and enables better zero-shot generalization than alternative model-free and model-based methods.

研究の動機と目的

  • 豊かな観測を持つ長時間スパンのタスクにおける階層的強化学習(HRL)における状態抽象化の課題に対処すること。
  • 不要な要因や外部要因に依存しないが、利用可能なスキルのタスク関連の機能的特徴を保持する状態表現を開発すること。
  • 機能的でスキルに配慮した埋め込み空間を構築することで、ハイレベルポリシーにおけるより良い一般化と計画を可能にすること。
  • 低レベルスキルの価値関数が、ハイレベル計画に適した効果的でコンパクトかつ頑健な表現として機能できることを示すこと。
  • VFSが複雑な環境におけるモデルフリーおよびモデルベースのハイレベルポリシーと両立できることを示すこと。

提案手法

  • VFSは、与えられた観測に対して利用可能なすべての低レベルスキルの価値関数を連結することで状態表現を構築する。
  • 価値関数は各スキルの期待報酬を符号化し、現在の状態におけるそのスキルの機能的特徴と事前条件を捉えている。
  • この表現は、物体の色、背景テクスチャ、アームポーズなどのタスクに無関係な要因に対して不変であり、機能的状態の同値性を保持する。
  • 本手法はモデルフリーおよびモデルベースの計画の両方と互換性があり、既存のHRLパイプラインに変更を加える必要がない。
  • 価値関数の内在的性質を活用して、可能なスキルの結果と完了済みの結果を統一された埋め込み空間でモデル化する。
  • 表現はトレーニング中にエンドツーエンドで学習され、ハイレベルポリシーの意思決定の入力として使用される。

実験結果

リサーチクエスチョン

  • RQ1低レベルスキルの価値関数は、機能的でスキル中心の状態表現として機能し、機能的特徴を捉えながらも不要な干渉要因を無視できるか?
  • RQ2スキルの価値関数から導出される表現は、複雑な環境における長時間スパンのタスク性能を向上させることができるか?
  • RQ3VFSは微調整なしに新しい環境へのゼロショット一般化を可能にするか?
  • RQ4計画効率と成功確率の観点から、VFSは対照的および情報理論的表現学習手法と比較してどのように差をつけるか?
  • RQ5VFS表現はモデルフリーおよびモデルベースのハイレベルポリシーの両方と互換性があるか?

主な発見

  • O5ロボット操作タスクでは、VFSは100%の成功確率を達成し、オラクル性能に一致し、すべてのベースラインを上回った。
  • より困難なO10タスクでは、VFSは80%の成功確率を達成し、オラクルの85%に近く接近した。
  • VAEおよびCPC表現はO10設定でそれぞれ30%および40%の成功確率に低下したのに対し、VFSは顕著に優れた性能を示した。
  • VFS埋め込みのt-SNE可視化では、ロボットが異なる物体を保持しているなどの機能的状態に対応する明確なクラスタが観察されたが、アームポーズや背景の変化といった無関係な変動は無視された。
  • VFSは再トレーニングなしに、新たな環境への頑健なゼロショット一般化を示した。
  • 本手法はモデルフリーおよびモデルベースの計画設定の両方で有効であり、既存のHRLフレームワークとの広範な互換性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。