Skip to main content
QUICK REVIEW

[論文レビュー] A Relational Intervention Approach for Unsupervised Dynamics Generalization in Model-Based Reinforcement Learning

Jixian Guo, Mingming Gong|arXiv (Cornell University)|Jun 9, 2022
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、ラベルなしの遷移セグメントから環境固有の要因 $\hat{Z}$ を学習することで、モデルベース強化学習(MBRL)における非教師あり動的一般化のための関係的介入手法(RIA)を提案する。介入モジュールを導入して、2つの $\hat{Z}$ ベクトルが同じ環境に属する確率を推定し、関係的ヘッドを用いて同様のベクトル同士の類似性を強制することで、冗長な情報の削減と、未学習の動的特性を持つ環境における動的予測精度および強化学習エージェントの性能向上を実現する。

ABSTRACT

The generalization of model-based reinforcement learning (MBRL) methods to environments with unseen transition dynamics is an important yet challenging problem. Existing methods try to extract environment-specified information $Z$ from past transition segments to make the dynamics prediction model generalizable to different dynamics. However, because environments are not labelled, the extracted information inevitably contains redundant information unrelated to the dynamics in transition segments and thus fails to maintain a crucial property of $Z$: $Z$ should be similar in the same environment and dissimilar in different ones. As a result, the learned dynamics prediction function will deviate from the true one, which undermines the generalization ability. To tackle this problem, we introduce an interventional prediction module to estimate the probability of two estimated $\hat{z}_i, \hat{z}_j$ belonging to the same environment. Furthermore, by utilizing the $Z$'s invariance within a single environment, a relational head is proposed to enforce the similarity between $\hat{Z}$ from the same environment. As a result, the redundant information will be reduced in $\hat{Z}$. We empirically show that $\hat{Z}$ estimated by our method enjoy less redundant information than previous methods, and such $\hat{Z}$ can significantly reduce dynamics prediction errors and improve the performance of model-based RL methods on zero-shot new environments with unseen dynamics. The codes of this method are available at \url{https://github.com/CR-Gjx/RIA}.

研究の動機と目的

  • 未知の遷移動的特性を示す環境へのモデルベース強化学習(MBRL)の一般化の課題に取り組む。
  • 従来の非教師あり手法が遷移セグメントから環境固有の要因 $Z$ を抽出するが、非動的関連の冗長な情報を含んでしまうという限界を克服する。
  • 推定された $\hat{Z}$ ベクトルが同じ環境内では類似しており、異なる環境間では相違するように保証する。これは $Z$ が持つ重要な性質を維持するためである。
  • 訓練環境とは異なる動的特性を持つ環境において、MBRLエージェントのロバスト性と一般化性能を向上させる。

提案手法

  • 文脈エンコーダーを用いて、履歴の遷移セグメントから環境固有の要因 $\hat{Z}$ を推定し、観測されていない $Z$ の代理として扱う。
  • 2つの $\hat{Z}$ ベクトルが同じ環境由来である確率を推定するための介入予測モジュールを導入し、コントラスト学習に基づくアプローチを採用する。
  • 高い環境間類似性を持つ $\hat{Z}$ ベクトルをクラスタリングする関係的ヘッドを設計し、1つの環境内での $\hat{Z}$ の不変性を強制する。
  • 洗練された $\hat{Z}$ を用いて動的予測モデルを訓練することで、未学習の動的特性への一般化を向上させる。
  • 同じ環境由来の $\hat{Z}$ ベクトルが潜在空間内で近くなるように、自己教師付きコントラスト的目的関数を用いる。
  • 学習された $\hat{Z}$ を動的モデルに統合し、異なる遷移動的特性を持つ環境間での一般化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしの遷移セグメントから、非動的関連の冗長な情報を含まずに環境固有の要因 $\hat{Z}$ を学習できるか?
  • RQ2非教師ありの枠組みの中で、1つの環境内での $\hat{Z}$ の不変性と、異なる環境間での相違性をどのように強制できるか?
  • RQ3提案された介入および関係的ヘッド機構は、軌道固有のノイズの影響を軽減し、動的特性の一般化を向上させるか?
  • RQ4先行する非教師あり手法と比較して、本手法は未学習の動的特性を持つ環境におけるMBRLエージェントのゼロショット一般化性能をどの程度向上させるか?

主な発見

  • CaDM や TMCL といったベースライン手法と比較して、未学習のテスト環境における動的予測誤差が顕著に低減された。
  • 同じ環境由来の推定 $\hat{Z}$ ベクトルは、介入モジュールによって高い類似度スコアを割り当てられ、非教師ありクラスタリングの有効性が示された。
  • RIA を用いて訓練されたモデルベース強化学習エージェントは、他の非教師あり手法で訓練されたエージェントと比較して、ゼロショットテスト環境における平均報酬が高かった。
  • アブレーションスタディの結果、関係的ヘッドと介入モジュールの両方が不可欠であることが確認された。特に、冗長な情報を低減する観点で、両者の欠落は性能の低下を引き起こした。
  • 真の環境ラベルを用いて $\hat{Z}$ をクラスタリングする教師ありベースラインと同等の性能を達成しており、強力な非教師あり分離性が裏付けられた。
  • 予測誤差曲線はトレーニング中に一貫した改善を示し、未学習の動的特性における一般化誤差も低く抑えられており、学習された $\hat{Z}$ のロバスト性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。