Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL

Rui Yang, Yiming Lu|arXiv (Cornell University)|Feb 9, 2022
Reinforcement Learning in Robotics被引用数 13
ひとこと要約

本論文は、割引報酬重み、目的条件付き指数的アドバンテージ重み、最良アドバンテージ重みを組み合わせた複合重み付け方式を導入することで、Goal-Conditioned Supervised Learning (GCSL) を強化するオフライン目標条件付き強化学習手法であるWeighted GCSL (WGCSL) を提案する。WGCSLは、目標到達目的のタイトな下界を最適化することを理論的に保証し、オンラインおよびオフラインの両設定で一貫した方策改善を達成する。本手法は、複雑なロボット操作タスクを含む新しいベンチマークにおいて、GCSL や最先端のオフライン強化学習手法を上回る性能を発揮する。

ABSTRACT

Solving goal-conditioned tasks with sparse rewards using self-supervised learning is promising because of its simplicity and stability over current reinforcement learning (RL) algorithms. A recent work, called Goal-Conditioned Supervised Learning (GCSL), provides a new learning framework by iteratively relabeling and imitating self-generated experiences. In this paper, we revisit the theoretical property of GCSL -- optimizing a lower bound of the goal reaching objective, and extend GCSL as a novel offline goal-conditioned RL algorithm. The proposed method is named Weighted GCSL (WGCSL), in which we introduce an advanced compound weight consisting of three parts (1) discounted weight for goal relabeling, (2) goal-conditioned exponential advantage weight, and (3) best-advantage weight. Theoretically, WGCSL is proved to optimize an equivalent lower bound of the goal-conditioned RL objective and generates monotonically improved policies via an iterated scheme. The monotonic property holds for any behavior policies, and therefore WGCSL can be applied to both online and offline settings. To evaluate algorithms in the offline goal-conditioned RL setting, we provide a benchmark including a range of point and simulated robot domains. Experiments in the introduced benchmark demonstrate that WGCSL can consistently outperform GCSL and existing state-of-the-art offline methods in the fully offline goal-conditioned setting.

研究の動機と目的

  • リラベルされた経験の均一な重み付けがオフライン設定におけるGCSLの性能を劣化させることを是正すること。
  • オフライン目標条件付き強化学習のための理論的根拠に基づいた一貫した方策改善フレームワークを確立すること。
  • 目的条件付き設定における教師付き模倣学習とオフライン強化学習のギャップを埋めること。
  • オフライン目標条件付き強化学習アルゴリズムの評価を目的とした、多様で挑戦的なマルチゴールロボット環境を含むベンチマークを開発すること。

提案手法

  • 割引報酬を組み込むことで、GCSLの理論的基盤を再考し、重み付けされた教師付き学習目的を導出する。
  • WGCSLに導入された複合重みは、3つの要素で構成される:目的リラベル用の割引重み、価値関数推定に基づく指数的アドバンテージ重み、マルチモーダルデータ用の最良アドバンテージ重み。
  • WGCSLが目的条件付き強化学習目的の同等の下界を最適化することを証明し、任意の行動方策のもとでも一貫した方策改善を保証する。
  • 価値関数を用いてアドバンテージを推定し、指数的重み付けを効果的に活用することで、学習効率と方策品質を向上させる。
  • 重み付けされた模倣学習スキームをオフラインデータセットに適用し、オンライン相互作用なしに安定的かつ効果的な方策学習を可能にする。
  • 実世界および合成データセットを用いた8つの環境を含む包括的なベンチマークを設計する。

実験結果

リサーチクエスチョン

  • RQ1重み付けされた模倣学習フレームワークは、オフライン目標条件付き強化学習設定におけるGCSLの性能を向上させ得るか?
  • RQ2提案された重み付け方式は、多様な行動方策に対して一貫した方策改善をもたらすか?
  • RQ3価値ベースのアドバンテージ重み付けの統合は、オフライン目標条件付き強化学習における学習効率と最終的性能をどのように向上させるか?
  • RQ4WGCSLは、複雑でマルチゴールなロボットタスクにおいて、既存の最先端のオフライン強化学習手法をどの程度上回るか?
  • RQ5WGCSLは、人間型ハンドを含む、非常にマルチモーダルかつスパarsely報酬の環境にも効果的に一般化可能か?

主な発見

  • WGCSLは、導入されたベンチマークの全環境において、GCSLおよび最先端のオフライン強化学習ベースラインを一貫して上回り、特に挑戦的なHandReachタスクで顕著な優位性を示す。
  • 人間型ハンド環境では、ランダムに収集されたスパarsely報酬データセットから学習した場合、WGCSLはGCSLおよび他のSOTA手法と比較して著しく高い成功確率を達成する。
  • 最良アドバンテージ重みの導入により、複数の有効な軌道が存在するマルチモーダルデータ環境において、漸近的性能が向上する。
  • 複合重み付け方式により、GCSLと比較して目標到達目的のタイトな下界が得られ、性能向上の理論的根拠が得られる。
  • WGCSLは、オフラインデータ収集に用いられた行動方策にかかわらず、全評価設定で一貫した方策改善を示す。
  • 実験的結果から、アドバンテージ推定のための価値関数学習は、追加の訓練コストを上回る性能向上をもたらすため、 worthwhile であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。