Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised Learning of Distance Functions for Goal-Conditioned Reinforcement Learning

Srinivas Venkattaramanujam, Eric Crawford|arXiv (Cornell University)|Jul 5, 2019
Reinforcement Learning in Robotics参考文献 23被引用数 11
ひとこと要約

本論文は、方策下での状態間の commute time(往復通過時間)の平方根を予測するためのニューラルネットワークを学習することで、ゴール条件付き強化学習におけるダイナミクスに配慮した距離関数を自己教師ありで学習する手法を提案する。このアプローチにより、複雑な環境においてドメイン知識を要しないオンライン学習が可能となり、手動で設計された距離メトリクスへの依存が著しく低下するとともに、サンプル効率とカリキュラム学習の両方が向上する。

ABSTRACT

Goal-conditioned policies are used in order to break down complex reinforcement learning (RL) problems by using subgoals, which can be defined either in state space or in a latent feature space. This can increase the efficiency of learning by using a curriculum, and also enables simultaneous learning and generalization across goals. A crucial requirement of goal-conditioned policies is to be able to determine whether the goal has been achieved. Having a notion of distance to a goal is thus a crucial component of this approach. However, it is not straightforward to come up with an appropriate distance, and in some tasks, the goal space may not even be known a priori. In this work we learn a distance-to-goal estimate which is computed in terms of the number of actions that would need to be carried out in a self-supervised approach. Our method solves complex tasks without prior domain knowledge in the online setting in three different scenarios in the context of goal-conditioned policies a) the goal space is the same as the state space b) the goal space is given but an appropriate distance is unknown and c) the state space is accessible, but only a subset of the state space represents desired goals, and this subset is known a priori. We also propose a goal-generation mechanism as a secondary contribution.

研究の動機と目的

  • ゴール条件付き強化学習における効果的な距離関数を設計する課題に取り組むこと。これはしばしば膨大なドメイン知識を要する。
  • L2距離の限界を克服し、実際の環境遷移コストを反映するダイナミクスに配慮した距離メトリクスを学習すること。
  • ポリシー学習と連携して、事前定義されたゴール空間や報酬形状に依存しない、オンラインで自己教師ありの距離関数学習を可能にすること。
  • 学習済み距離関数を活用して、実行可能で段階的に難易度が上がるゴールを自動的に選択するカリキュラム生成メカニズムの開発。
  • オンポリシー距離学習におけるエプシロン・スフィアの拡大問題を緩和すること。これはゴール到達評価やハイパーパramータチューニングを困難にする。

提案手法

  • 2つの状態間の距離を、行動方策下での期待 commute time(両方向の最初の通過時間)の平方根として定義する。
  • その埋め込みが、この commute-time に基づく距離をp-ノルムで近似するように、ニューラルネットワークを学習させる。
  • ポリシーが収集するオンライン経験を用いて、時間的近接性に基づく対照的損失を用いて自己教師ありで距離ネットワークを学習する。
  • グラフラプラシアンとの関連を活用することで、このような埋め込み空間の存在を理論的に裏付け、正当化する。
  • オンポリシー学習で観察されるエプシロン・スフィアの拡大問題を回避するため、距離予測子のためのオフポリシー学習スキームを実装する。
  • 学習済み距離関数をゴール条件付きポリシー学習パイプラインに統合し、ゴール空間におけるアクションノイズを用いた自動ゴール生成を可能にする。

実験結果

リサーチクエスチョン

  • RQ1環境の真のダイナミクスを反映するオンライン自己教師あり距離関数を学習可能か? これは静的な状態差ではなく、実際の遷移コストに基づく。
  • RQ2距離予測子のオンポリシー学習とオフポリシー学習の選択が、ゴール条件付き学習プロセスの安定性とスケーラビリティに与える影響は?
  • RQ3学習済み距離関数は、高次元で複雑な環境において、L2距離のような手動設計メトリクスをどれだけ代替可能か?
  • RQ4学習済み距離関数は、ゴール空間に関する事前知識なしに、効果的な自動カリキュラム学習を可能にするか?
  • RQ5オンポリシー距離学習におけるエプシロン・スフィアの拡大現象の実用的影響は何か? そして、どのように緩和できるか?

主な発見

  • 提案手法は、状態の近接性がタスクの近接性を示さない環境において、L2距離を著しく上回る性能を達成するダイナミクスに配慮した距離関数を学習する。
  • 自己教師あり距離ネットワークは理論的な commute time 距離を効果的に近似し、状態空間における時間的遷移コストを保持する埋め込みを実現する。
  • オンポリシー学習ではエプシロン・スフィアが拡大し、ゴールに「近い」と見なされる状態の領域が時間経過とともに拡大する。これはハイパーパramータチューニングを困難にする。
  • オフポリシー学習により距離関数が安定化し、エプシロン・スフィアの拡大が防がれる。これにより、信頼性の高いゴール評価とカリキュラム学習が可能になる。
  • 本手法により、GANのトレーニングや実行可能性チェックを必要とせず、アクションノイズを用いた自動ゴール生成が効果的に実現され、GoalGANと同等の性能を達成する。
  • Maze Ant および Free Ant 環境における実験結果から、ドメイン知識への依存が低減され、オンラインのゴール条件付き強化学習におけるサンプル効率が向上することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。