Skip to main content
QUICK REVIEW

[論文レビュー] Lipschitz-constrained Unsupervised Skill Discovery

Seohong Park, Jongwook Choi|arXiv (Cornell University)|Feb 2, 2022
Reinforcement Learning in Robotics被引用数 8
ひとこと要約

Lipschitz制約付きスキル発見(LSD)は、状態表現にLipschitz制約を課すことで、動的で広範囲にわたる多様なスキルを促進する、新たな教師なしスキル発見手法を提案する。MuJoCoの走破および操作環境において、スキル多様性、状態空間カバレッジ、および下流のゴール追従タスクにおけるゼロショット性能の面で、MIベースの手法を上回る。

ABSTRACT

We study the problem of unsupervised skill discovery, whose goal is to learn a set of diverse and useful skills with no external reward. There have been a number of skill discovery methods based on maximizing the mutual information (MI) between skills and states. However, we point out that their MI objectives usually prefer static skills to dynamic ones, which may hinder the application for downstream tasks. To address this issue, we propose Lipschitz-constrained Skill Discovery (LSD), which encourages the agent to discover more diverse, dynamic, and far-reaching skills. Another benefit of LSD is that its learned representation function can be utilized for solving goal-following downstream tasks even in a zero-shot manner - i.e., without further training or complex planning. Through experiments on various MuJoCo robotic locomotion and manipulation environments, we demonstrate that LSD outperforms previous approaches in terms of skill diversity, state space coverage, and performance on seven downstream tasks including the challenging task of following multiple goals on Humanoid. Our code and videos are available at https://shpark.me/projects/lsd/.

研究の動機と目的

  • スケーリングや可逆変換に対して不変であるため、静的で変動が小さいスキルを好むMIベースのスキル発見手法の限界を解消する。
  • 動的走破や操作スキルを促進するために、手動による特徴工学やドメイン固有の事前知識(例:x-y座標)の必要性を克服する。
  • 外部報酬なしで、大規模な状態空間変動と長距離の行動を内蔵的に促進するスキル発見目的関数を開発する。
  • 追加の訓練や計画なしに、学習済み表現を用いて下流のゴール追従タスクへのゼロショット転送を可能にする。
  • ハイパーパrameterフリーの単純な手法を提供し、スキル多様性とカバレッジを向上させつつ、強力な下流性能を維持する。

提案手法

  • 表現関数が有界定数を用いてLipschitz連続であることを制約することで、状態空間内を移動する距離を最大化するLipschitz制約付き目的関数を提案する。
  • スキルと状態の間の相互情報量の正則化最大化としてスキル発見目的関数を定式化し、大規模な状態変動を促進するためのLipschitzペナルティを追加する。
  • 異なる潜在変数が異なるかつ遠くまで到達する状態軌道を生成するように、ポリシーがスキル潜在変数を行動にマップするための対照学習フレームワークを用いる。
  • 単純な線形層を用いて、学習済み状態表現からゴール状態へのスキル潜在変数の直接回帰により、ゼロショットゴール追従を実現する。
  • スキルポリシーを固定し、下流タスク用に階層的メタコントローラーを上に訓練することで、標準RLパイプラインに統合する。
  • 事前学習中にタスク固有の報酬や内因的形状なしに、走破(Ant, Humanoid)および操作(Fetch)環境に本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1状態表現関数にLipschitz制約を課すことで、教師なしスキル発見において動的で多様なスキルを効果的に促進できるか?
  • RQ2手動による特徴工学が不要な状態で、LSDはMIベースのベースラインより状態空間カバレッジおよびスキル多様性において優れているか?
  • RQ3LSDが学習した表現は、追加の訓練や複雑な計画なしに、複数のゴールに対してゼロショットゴール追従を可能にするか?
  • RQ4HumanoidにおけるマルチゴールナビゲーションやFetchにおけるオブジェクト操作といった挑戦的な下流タスクにおいて、LSDはどのように性能を発揮するか?
  • RQ5LSDは、走破および操作を含むさまざまなロボット制御タスクにおいて、頑健かつ汎用的か?

主な発見

  • LSDは5つのMuJoCo環境において、MIベースのベースライン(DIAYNやMDPなど)を著しく上回る最高の状態空間カバレッジを達成した。
  • AntMultiGoalsおよびHumanoidMultiGoalsタスクにおいて、LSDは、タスク固有の内因的報酬や事前知識を用いた手法ですら上回る最終的な累積報酬を達成した。
  • LSDのゼロショットスキル選択(再訓練なし)は、AntMultiGoalsで最良の性能を示し、他のタスクでも競争力を持つ結果となり、優れた一般化性能を示した。
  • Fetch操作タスクでは、LSDがx-y平面全体にわたり最も多様な方向にターゲットオブジェクトを移動させるスキルを学習したことが、軌道マップの可視化で確認された。
  • LSDは、すべての3つのFetch環境において、0.1×0.1のボックスで測定した状態空間カバレッジで最高の性能を達成し、優れた探索能力とスキル多様性を示した。
  • 本手法は追加のハイパーパrameterが不要で、実装が容易でありながら、特徴工学や内因的報酬を用いた複雑なベースラインを上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。