Skip to main content
QUICK REVIEW

[論文レビュー] Autonomous discovery of the goal space to learn a parameterized skill

Emilio Cartoni, Gianluca Baldassarre|arXiv (Cornell University)|May 19, 2018
Reinforcement Learning in Robotics参考文献 8被引用数 11
ひとこと要約

本論文では、タスク空間の事前知識がなくても、高次元のセンサースペース(例:カメラ画像)内での到達可能なゴールの多様体を自律的に発見するアルゴリズムAGMEを提案する。発見されたゴールのグラフを構築し、新しいゴールの可能性が高いかつてない領域を能動的に探索することで、AGMEは、センサースペースのわずか一部にしか到達可能な結果が存在しない状況でも、従来のスキル・バブリングと比較して、画像ベースの環境で優れた性能を発揮するパrameterizedスキル学習を効率的に行う。

ABSTRACT

A parameterized skill is a mapping from multiple goals/task parameters to the policy parameters to accomplish them. Existing works in the literature show how a parameterized skill can be learned given a task space that defines all the possible achievable goals. In this work, we focus on tasks defined in terms of final states (goals), and we face on the challenge where the agent aims to autonomously acquire a parameterized skill to manipulate an initially unknown environment. In this case, the task space is not known a priori and the agent has to autonomously discover it. The agent may posit as a task space its whole sensory space (i.e. the space of all possible sensor readings) as the achievable goals will certainly be a subset of this space. However, the space of achievable goals may be a very tiny subspace in relation to the whole sensory space, thus directly using the sensor space as task space exposes the agent to the curse of dimensionality and makes existing autonomous skill acquisition algorithms inefficient. In this work we present an algorithm that actively discovers the manifold of the achievable goals within the sensor space. We validate the algorithm by employing it in multiple different simulated scenarios where the agent actions achieve different types of goals: moving a redundant arm, pushing an object, and changing the color of an object.

研究の動機と目的

  • 到達可能なゴールの集合が事前に不明な環境において、パrameterizedスキルの自律的かつオープンエンドな学習を可能にすること。
  • カメラ画像などの高次元センサースペースにおいて、到達可能な状態の割合が非常に小さい場合に生じる次元の呪いを克服すること。
  • 事前にタスクパラメータを定義する必要がなかったり、センサースペース全体を一様にサンプリングする必要がない方法を開発すること。
  • 既知のゴールの動的グラフに基づいて、有望な領域に焦点を当てることで、効果的な探索と新しいゴールの発見を可能にすること。
  • エンジニアリングされたゴール変数が不要な、生のセンサ入力(例:画像)をゴール空間として使用する、強固なパrameterizedスキル学習を実現すること。

提案手法

  • アルゴリズムは、センサースペース内の発見済みゴールをグラフ表現として構築し、ノードが達成された結果を表し、エッジがそれらの間の近接性を表す。
  • 探索中に回帰器に依存しない非パrametricなアプローチを採用し、代わりにk近傍法を用いて新しいゴールのためのポリシーを取得する。
  • 既知のゴールから未探索領域までの距離を測定することで探索をガイドし、新しい有効なゴールが得られる可能性の高い領域を優先する。
  • センサースペース全体をサンプリングするのではなく、既知のゴールから出発し、能動的探索によって外側へ拡張することで、全空間のサンプリングを回避する。
  • 到達可能なゴールの内蔵多様体構造を活用することで、高次元スパarsityを回避し、学習効率を向上させる。
  • 性能評価には、指定されたゴールに許容誤差内に到達する頻度を測る距離ベースの成功指標を用いる。

実験結果

リサーチクエスチョン

  • RQ1タスク空間の事前知識がなくても、高次元センサースペースにおいて到達可能なゴールの多様体を自律的に発見できるか?
  • RQ2到達可能な状態の割合が非常に小さいセンサースペースにおいて、効率的な探索をどのようにガイドできるか?
  • RQ3事前に定義されたゴール変数がなくても、生のセンサ入力(例:画像)をゴール空間として使用してパrameterizedスキルを効果的に学習できるか?
  • RQ4スキル・バブリングなどの従来手法と比較して、画像ベースの環境における探索効率と成功確率の面で、本手法はどのように優れているか?
  • RQ5本手法は、タスク固有の修正なしに、さまざまな種類のゴールやポリシーに一般化できる程度はどの程度か?

主な発見

  • AGMEは、タスク空間の事前知識がなくても、高次元センサースペース(例:カメラ画像)における到達可能なゴールの多様体を効果的に発見した。
  • センサースペースが極めて高次元(例:320x240の画像では80000次元以上)であっても、事前に定義されたタスク固有のゴール空間を使用した場合と同等の性能を達成した。
  • アーム操作、オブジェクト押し、色変更タスクを含む実験において、AGMEは、高次元空間での探索が不十分なために失敗するスキル・バブリングよりも優れた性能を示した。
  • 全センサースペースのサンプリングを避けることで、次元の呪いを回避し、到達可能なゴールの内蔵構造に焦点を当てた。
  • AGMEのグラフベース探索戦略により、高い可能性を示す領域を優先することで、非到達状態への無駄な探索を減らし、新しいゴールの効果的発見が可能になった。
  • 非パrametricな性質のおかげで、初期学習段階において不正確な回帰器に依存せず、k近傍法によるポリシー取得が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。