Skip to main content
QUICK REVIEW

[論文レビュー] Learning Goal-Conditioned Policies Offline with Self-Supervised Reward Shaping

Lina Mezghani, Sainbayar Sukhbaatar|arXiv (Cornell University)|Jan 5, 2023
Intelligent Tutoring Systems and Adaptive Learning被引用数 4
ひとこと要約

本論文は、人為的に設計された報酬が一切不要な、オフライン・ゴール条件付き強化学習のための自己教師付き報酬形状化手法を提案する。この手法は、事前に収集された軌道から密集した報酬を学習する。到達可能性ネットワークの訓練、代表的状態の抽出、状態空間グラフの構築により、長時間スケールのポリシーの効率的学習を可能にし、UMaze、RoboYoga Walker、Pusherといった連続制御タスクにおいて、先行するヒューリスティックリラベル化ベースラインを著しく上回る性能を発揮する。

ABSTRACT

Developing agents that can execute multiple skills by learning from pre-collected datasets is an important problem in robotics, where online interaction with the environment is extremely time-consuming. Moreover, manually designing reward functions for every single desired skill is prohibitive. Prior works targeted these challenges by learning goal-conditioned policies from offline datasets without manually specified rewards, through hindsight relabelling. These methods suffer from the issue of sparsity of rewards, and fail at long-horizon tasks. In this work, we propose a novel self-supervised learning phase on the pre-collected dataset to understand the structure and the dynamics of the model, and shape a dense reward function for learning policies offline. We evaluate our method on three continuous control tasks, and show that our model significantly outperforms existing approaches, especially on tasks that involve long-term planning.

研究の動機と目的

  • 事前に収集されたデータセットからの、報酬設計なしに、マルチタスク・ゴール条件付きポリシーのオフライン・自己教師付き学習を可能にすること。
  • 従来のオフライン強化学習手法が直面する、長時間スケールタスクにおける報酬の疎らさという課題に対処すること。
  • 軌道から環境のダイナミクスと構造を学習する自己教師付き段階を構築し、密集した意味のある報酬を形状化すること。
  • エキスパートのデモンストレーションが不要な状態で、低品質なデータセット(例:ランダムポリシーで収集されたもの)に対しても効果的なポリシー学習を可能にすること。
  • パイプラインのいかなる段階においても、追加の環境との相互作用や手動で設計された報酬関数の必要性を排除すること。

提案手法

  • オフラインデータセットからの遷移を用いて、状態空間内の局所的距離を推定する到達可能性ネットワークを訓練する。
  • 状態空間全体をカバーする代表的状態の集合を抽出し、グローバル距離の近似に用いるランドマークとする。
  • 代表的状態の上にグラフを構築し、最短経路計算を用いて状態空間内のグローバル距離をモデル化する。
  • グラフを用いて、ゴールまでの最短経路距離に基づき、ポリシー学習中に密集した報酬を生成する。
  • グラフ経路に沿った中間遷移をデータセットに追加し、ポリシーの一般化性能と学習安定性を向上させる。
  • 報酬関数や環境との相互作用を一切用いずに、自己教師付き密集報酬と拡張された遷移を用いてゴール条件付きポリシーを訓練する。

実験結果

リサーチクエスチョン

  • RQ1オフライン軌道からの自己教師付き表現学習は、人為的報酬なしに密集報酬形状化を可能にするか?
  • RQ2密集報酬形状化は、長時間スケールのゴール条件付き制御タスクにおける学習効率と性能を向上させるか?
  • RQ3本手法は、ランダムポリシーで収集されたような低品質データセットからも、効果的なポリシーを学習できるか?
  • RQ4本手法は、HER や Actionable Models といったヒューリスティックリラベル化ベースラインと比較して、オフライン・ゴール条件付き強化学習でどのように性能を発揮するか?
  • RQ5データ収集段階や学習段階で報酬の監視なしに、本手法は複雑な連続制御環境へ一般化可能か?

主な発見

  • UMazeタスクにおいて、本手法はHERやActionable Modelsを著しく上回り、初期状態から遠いゴールに対して特に優れた長時間スケール計画性能を示した。
  • RoboYoga Walkerタスクでは、本手法がベースラインを上回る優れた性能を発揮した一方、Actionable Modelsは標準的なHERと変わらず、より高いサンプル効率と一般化性能を示した。
  • Pusherタスクでは、本手法がすべてのベースラインより平均的、ハンド、パックのゴールへの距離が小さく、正確で順次的な制御能力を示した。
  • ランダムポリシーで収集されたデータセットからも、本手法は効果的なポリシーを学習でき、低品質データに対するロバストネスを証明し、エキスパートデモンストレーションの必要性を排除した。
  • グラフベースの密集報酬形状化により、特に複雑な環境において、疎報酬手法と比較して収束が速く、学習がより安定した。
  • 本手法は、データ収集段階、学習段階、評価段階のいかなる段階においても報酬関数を一切必要としない、完全に自己教師付きのオフライン・ゴール条件付きポリシー学習を実現した最初の手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。