Skip to main content
QUICK REVIEW

[論文レビュー] Trajectory-wise Multiple Choice Learning for Dynamics Generalization in Reinforcement Learning

Younggyo Seo, Kimin Lee|arXiv (Cornell University)|Oct 25, 2020
Reinforcement Learning in Robotics被引用数 14
ひとこと要約

本稿では、動的特性が異なる環境にわたって一般化できるように学習するモデルベース強化学習手法であるTrajectory-wise Multiple Choice Learning(T-MCL)を提案する。T-MCLは、動的特性クラスタごとに予測ヘッドを特化させるための軌道単位のオラクル損失と、オンライン適応を可能にするコンテキスト学習を用いる。この手法により、CrippledAnt環境において、先行手法よりも平均報酬で3.5倍優れたゼロショット一般化性能を達成した。

ABSTRACT

Model-based reinforcement learning (RL) has shown great potential in various control tasks in terms of both sample-efficiency and final performance. However, learning a generalizable dynamics model robust to changes in dynamics remains a challenge since the target transition dynamics follow a multi-modal distribution. In this paper, we present a new model-based RL algorithm, coined trajectory-wise multiple choice learning, that learns a multi-headed dynamics model for dynamics generalization. The main idea is updating the most accurate prediction head to specialize each head in certain environments with similar dynamics, i.e., clustering environments. Moreover, we incorporate context learning, which encodes dynamics-specific information from past experiences into the context latent vector, enabling the model to perform online adaptation to unseen environments. Finally, to utilize the specialized prediction heads more effectively, we propose an adaptive planning method, which selects the most accurate prediction head over a recent experience. Our method exhibits superior zero-shot generalization performance across a variety of control tasks, compared to state-of-the-art RL methods. Source code and videos are available at https://sites.google.com/view/trajectory-mcl.

研究の動機と目的

  • 実世界のロボット作業のような、予期しない動的特性の変化が生じる状況において、モデルベース強化学習の一般化性能が著しく低下する問題に対処すること。
  • 事前環境知識なしに、多様な遷移分布を捉える動的モデルを学習すること。
  • コンテキスト条件付きモデリングを用いて、未観測の環境へのオンライン適応を可能にすること。
  • 最近の経験に基づいて、最も適切な予測ヘッドを動的に選択することで、計画の効率性と正確性を向上させること。
  • 多様な動的特性を有するさまざまな制御タスクにおいて、優れたゼロショット一般化性能を達成すること。

提案手法

  • 軌道単位のオラクル損失を導入し、軌道セグメント内で最も正確な予測ヘッドのみを更新することで、動的特性の類似性に基づいて環境を無教師でクラスタリング可能にする。
  • 過去の経験を符号化する潜在的コンテキストベクトルを用いたコンテキスト条件付きマルチヘッド動的モデルを採用し、予測を環境固有の動的特性に条件づける。
  • 最近の経験の範囲内で最も正確な予測ヘッドを選択する適応的計画を用い、効果的に最も近い動的特性クラスタに到達する。
  • 明示的な教師信号なしに、各動的モードごとに特化するよう促す新しい損失関数を用いて、マルチヘッドモデルをエンドツーエンドで学習する。
  • 複数のヘッドを持つ潜在的動的モデルを活用し、各ヘッドが特定の動的特性クラスタの遷移を予測するように学習させる。
  • コンテキスト埋め込みのt-SNE可視化を用い、動的特性の種類ごとに分離していることから、有効な表現学習が行われていることを検証した。

実験結果

リサーチクエスチョン

  • RQ1明示的なクラスタリングの教師信号なしに、マルチヘッド動的モデルが異なる動的特性クラスタに特化して学習できるか?
  • RQ2コンテキスト学習が、動的特性が変更された未観測環境へのゼロショット適応をどのように向上させるか?
  • RQ3最もパフォーマンスの良い予測ヘッドを選択する適応的計画は、サンプル効率性と最終的なパフォーマンスを向上させられるか?
  • RQ4予測ヘッド数や計画ホライズンといったハイパーパrameterの選択に、この手法はどれほど頑健か?
  • RQ5標準的なマルチヘッドやアンサンブル手法と比較して、オラクル損失を軌道単位で学習することは、より優れた一般化性能をもたらすか?

主な発見

  • T-MCLは、CrippledAnt環境においてCaDMよりも平均報酬が3.5倍高く、最先端のゼロショット一般化性能を実証した。
  • コンテキスト学習を除去すると、パフォーマンスが急激に低下し、未観測の動的特性へのオンライン適応を可能にする上で、その重要性が確認された。
  • コンテキスト埋め込みのt-SNE可視化により、動的特性の種類ごとに明確にクラスタリングされていることが示され、適切な表現学習が行われていることが裏付けられた。
  • H=3の予測ヘッドを用いた場合にパフォーマンスがピークに達し、HalfCheetah環境の多様な動的特性を捉えるには3つのヘッドで十分であることが示された。
  • 軌道単位の損失ホライズン(M)および適応的計画ホライズン(N)の変動に対しても、性能が向上する傾向にあり、手法の頑健性が確認された。
  • コンテキスト学習なしでも、T-MCLはPETSや他のベースラインを上回った。これは、本手法の軌道単位の学習メカニズムの有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。