Skip to main content
QUICK REVIEW

[論文レビュー] Dynamical Distance Learning for Semi-Supervised and Unsupervised Skill Discovery

Kristian Hartikainen, Xinyang Geng|arXiv (Cornell University)|Jul 18, 2019
Reinforcement Learning in Robotics被引用数 9
ひとこと要約

本稿では、自己収集した経験を用いた教師あり回帰により、任意の状態からゴール状態に到達するまでの期待ステップ数を測る距離関数を学習する、動的距離学習(DDL)を提案する。この手法により、報酬関数なしで、半教師あり(10個の人の好みラベルを用いて)および無教師の状態で、効率的なスキル発見が可能となり、手動の報酬設計なしに、生の画像から9自由度の高度な操作(バルブの操作)を現実世界で実現した。

ABSTRACT

Reinforcement learning requires manual specification of a reward function to learn a task. While in principle this reward function only needs to specify the task goal, in practice reinforcement learning can be very time-consuming or even infeasible unless the reward function is shaped so as to provide a smooth gradient towards a successful outcome. This shaping is difficult to specify by hand, particularly when the task is learned from raw observations, such as images. In this paper, we study how we can automatically learn dynamical distances: a measure of the expected number of time steps to reach a given goal state from any other state. These dynamical distances can be used to provide well-shaped reward functions for reaching new goals, making it possible to learn complex tasks efficiently. We show that dynamical distances can be used in a semi-supervised regime, where unsupervised interaction with the environment is used to learn the dynamical distances, while a small amount of preference supervision is used to determine the task goal, without any manually engineered reward function or goal examples. We evaluate our method both on a real-world robot and in simulation. We show that our method can learn to turn a valve with a real-world 9-DoF hand, using raw image observations and just ten preference labels, without any other supervision. Videos of the learned skills can be found on the project website: https://sites.google.com/view/dynamical-distance-learning.

研究の動機と目的

  • 視覚ベースのロボット制御において、特に深刻な手動の報酬関数設計の課題に対処すること。
  • 特に生の画像観測を用いる場合に顕著な非効率性と脆さを示すヒューリスティックな報酬設計の欠点を克服すること。
  • 示範、報酬関数、真のゴール例なしに、半教師ありおよび無教師のスキル発見を可能にすること。
  • 高次元の観測(例:画像)と標準的な深層強化学習アルゴリズムに統合可能なスケーラブルで安定した手法を開発すること。
  • 最小限の人的監視で、現実世界のロボット学習における手法の有効性を実証すること。

提案手法

  • 環境との自己教師的相互作用によって収集した軌道を用いて、動的距離を教師あり回帰で学習する。
  • 予測されたゴールまでの距離を、標準的な深層強化学習アルゴリズムの形状化報酬信号として用い、効率的なポリシー学習を可能にする。
  • 半教師あり設定では、人間が提供する好みラベルを用いてゴール状態を特定し、距離学習をガイドする。
  • 無教師設定では、最も動的距離が遠い状態をゴールとして選択し、探索とスキル発見を促進する。
  • 時間差分の監視を用いて、任意の状態からゴール状態に到達するまでの期待ステップ数を予測するためのニューラルネットワークを訓練する。
  • 学習された距離関数を、SACのようなオフポリシー強化学習アルゴリズムに統合し、サンプル効率の良いポリシー最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1教師あり回帰で学習した動的距離は、複雑で高次元の環境において、従来の価値ベースの手法(例:Q学習)を上回る性能を示すか?
  • RQ2少数の人の好みラベルが、現実世界のロボット操作タスクにおける有効なスキル習得をどの程度可能にするか?
  • RQ3動的距離が遠い状態に基づく無教師探索は、一切の監視なしに多様で複雑な歩行スキルを発見できるか?
  • RQ4特にスキルの複雑さと到達可能性の観点から、DDLはDIAYNのような先行手法と比べてどのように異なるか?
  • RQ5DDLは、生の画像観測と最小限の人的フィードバックのみで、現実世界での複雑な高度な操作タスクの学習を可能にするか?

主な発見

  • 半教師ありDDLの変種は、10個の人の好みラベルと生の画像観測のみを用いて、実世界の9自由度ハンドで180度のバルブ操作を学習し、8時間でタスクを成功させた。
  • Hopper-v3を除くすべてのタスクにおいて、学習速度と最終的性能の両面で、先行する好みベースのRL手法を上回り、優れたサンプル効率を示した。
  • 無教師スキル発見において、DDLUSはDIAYNよりも原点からはるかに遠くまで移動する歩行スキルを学習し、多様な方向性の行動を示しており、より高いスキルの複雑さを示した。
  • 動的距離が遠い状態への到達を最大化することで、無教師の状態でInvertedDoublePendulum-v2タスクを効果的に解決し、失敗を回避した。
  • 特に高次元の観測空間において、Q学習のような近似動的プログラミング手法よりも、ゴール条件付きポリシーの学習で優れた性能を示した。
  • 本手法は高次元入力(例:画像)に対して頑健であり、手動の報酬設計や示範なしに、直接現実世界への展開が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。