Skip to main content
QUICK REVIEW

[論文レビュー] Self-Imitation Learning via Trajectory-Conditioned Policy for Hard-Exploration Tasks

Yijie Guo, Jongwook Choi|arXiv (Cornell University)|Sep 25, 2019
Reinforcement Learning in Robotics参考文献 65被引用数 13
ひとこと要約

本論文は、自己模倣学習のための軌道条件付き方策を提案し、エージェントが多様な過去の軌道を模倣可能にすることで、エキスパートのデモンストレーションが不要な状況でも、困難な探索タスクにおける探索性を向上させることを可能にした。孤立した高報酬エピソードに注目するのではなく、多様な成功行動から学習することで、短視眼的な行動を回避し、モンテズマのレヴェンで20,000点を超える新しいSOTAスコアを達成した。

ABSTRACT

Imitation learning from human-expert demonstrations has been shown to be greatly helpful for challenging reinforcement learning problems with sparse environment rewards. However, it is very difficult to achieve similar success without relying on expert demonstrations. Recent works on self-imitation learning showed that imitating the agent's own past good experience could indirectly drive exploration in some environments, but these methods often lead to sub-optimal and myopic behavior. To address this issue, we argue that exploration in diverse directions by imitating diverse trajectories, instead of focusing on limited good trajectories, is more desirable for the hard-exploration tasks. We propose a new method of learning a trajectory-conditioned policy to imitate diverse trajectories from the agent's own past experience and show that such self-imitation helps avoid myopic behavior and increases the chance of finding a globally optimal solution for hard-exploration tasks, especially when there are misleading rewards. Our method significantly outperforms existing self-imitation learning and count-based exploration methods on various hard-exploration tasks with local optima. In particular, we report a state-of-the-art score of more than 20,000 points on Montezuma's Revenge without using expert demonstrations or resetting to arbitrary states.

研究の動機と目的

  • 従来の自己模倣学習が短視眼的な行動を引き起こすため、報酬が疎で探索が困難な環境における課題に対処すること。
  • 最高報酬を達成したエピソードのみに注目するのではなく、複数の過去の軌道を模倣することで、探索の多様性を向上させること。
  • 報酬が密集している状況において、エキスパートデモンストレーションや環境リセットに依存するのを減らすこと。
  • 誤った報酬や局所最適解がある環境において、グローバル最適方策を発見する可能性を高めること。

提案手法

  • 特定の過去の軌道に条件づけられた方策を学習させることで、多様な成功行動を模倣可能にする。
  • エージェントの経験バッファから、多様な高報酬の軌道を選択し、後で模倣できるように保存する。
  • 各選択された軌道で示された行動を模倣するための模倣損失を用いて方策を学習する。
  • これらの多様な軌道に基づいて定期的に方策をファインチューニングすることで、探索を強化し、より広い状態空間をカバーする。
  • エージェントが同じ狭い経路を繰り返し学習するのを防ぐことで、局所最適解への過剰適合を回避する。
  • エキスパートデモンストレーションや環境リセットを一切必要とせず、エージェント自身の経験にのみ依存する。

実験結果

リサーチクエスチョン

  • RQ1最高報酬を達成したエピソードのみに注目するのではなく、多様な軌道を模倣することで、自己模倣学習を改善できるか?
  • RQ2軌道条件付きの模倣は、局所最適解がある報酬が疎な環境で短視眼的な行動を軽減できるか?
  • RQ3この手法は、エキスパートデータなしで、モンテズマのレヴェンのような困難な探索タスクでSOTA性能を達成できるか?
  • RQ4サンプル効率および最終的なパフォーマンスの観点から、本手法はカウンティングベース探索や標準的な自己模倣ベースラインと比較してどう異なるか?

主な発見

  • 提案手法は、局所最適解がある困難な探索タスクにおいて、標準的な自己模倣学習やカウンティングベース探索手法を著しく上回った。
  • エキスパートデモンストレーションや環境リセットを一切使用せず、モンテズマのレヴェンで20,000点を超える新しいSOTAスコアを達成した。
  • 単一の高報酬経路に収束するのではなく、多様な軌道を模倣することで、短視眼的な行動を低減した。
  • 軌道条件付き方策の使用により、誤った報酬がある環境でも、より効果的かつ安定した学習が可能になった。
  • ベースライン手法と比較して、報酬が疎な環境において優れたサンプル効率と頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。