Skip to main content
QUICK REVIEW

[論文レビュー] BYOL-Explore: Exploration by Bootstrapped Prediction

Zhaohan Daniel Guo, Shantanu Thakoor|arXiv (Cornell University)|Jun 16, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

BYOL-Exploreは、潜在空間におけるブートストラップ予測を活用することで、視覚的に複雑な環境における好奇心駆動型探索のための統合的で自己教師ありアプローチを提案する。外在的報酬のみを用いてDM-HARD-8ベンチマークで人間水準のパフォーマンスを達成し、人的なデモを必要としない先行手法を上回る性能を発揮する。

ABSTRACT

We present BYOL-Explore, a conceptually simple yet general approach for curiosity-driven exploration in visually-complex environments. BYOL-Explore learns a world representation, the world dynamics, and an exploration policy all-together by optimizing a single prediction loss in the latent space with no additional auxiliary objective. We show that BYOL-Explore is effective in DM-HARD-8, a challenging partially-observable continuous-action hard-exploration benchmark with visually-rich 3-D environments. On this benchmark, we solve the majority of the tasks purely through augmenting the extrinsic reward with BYOL-Explore s intrinsic reward, whereas prior work could only get off the ground with human demonstrations. As further evidence of the generality of BYOL-Explore, we show that it achieves superhuman performance on the ten hardest exploration games in Atari while having a much simpler design than other competitive agents.

研究の動機と目的

  • 視覚的に豊かな、部分的に観察可能な環境で、外在的報酬が疎である状況における効率的探索の課題に対処すること。
  • 単一の自己教師あり予測目的に基づいて、世界の表象学習と好奇心駆動型ポリシー学習を統合すること。
  • ハードな探索設定において、補助的目標、人的なデモ、または複雑な記憶メカニズムへの依存を排除すること。
  • 多様で高次元の制御タスク、特にDM-HARD-8とAtariゲームにおける一般化を示すこと。

提案手法

  • BYOLにインspiredされたブートストラップされた潜在予測メカニズムを採用し、エージェントが自らの潜在表現の遅延版を予測する。
  • 潜在空間における予測誤差を、表象学習と内因的報酬設計の両方の唯一の学習目的として使用する。
  • 訓練の安定化と表象の一貫性向上のため、EMA(指数移動平均)ターゲットネットワークを適用する。
  • 多段階のオープンループ予測(予測ホライズンK)を用いて、長期的な計画と将来の状態予測を促進する。
  • 学習の安定化とサンプル効率の向上のため、内因的報酬をクリッピングによって正規化する。
  • 世界モデルと単一のポリシー・ネットワークを同じ損失関数で同時に学習させ、補助的目標なしにエンドツーエンドの訓練を可能にする。

実験結果

リサーチクエスチョン

  • RQ1潜在空間における単一の自己教師あり予測損失が、視覚的に複雑で部分的に観察可能な環境での探索を効果的に駆動できるか?
  • RQ2ブートストラップされた潜在予測は、ICM や RND といった従来の好奇心手法を上回る性能を発揮するか?
  • RQ3統合された世界モデルとポリシー学習フレームワークが、人的なデモなしで人間水準のパフォーマンスを達成できるか?
  • RQ4予測ホライズンK や EMA の減衰係数αといったハイパーパrameterの選択に対して、この手法はどれほど頑健か?
  • RQ5このアプローチは、報酬が疎な3D環境やAtariゲームを含む多様な環境に一般化できるか?

主な発見

  • BYOL-Exploreは、外在的報酬にその内因的報酬を追加するだけで、人的なデモを一切不要とし、DM-HARD-8ベンチマークの8タスク中7つで人間水準のパフォーマンスを達成した。
  • ICM や RND ですら、最適なパラメータチューニングを施したとしても、すべてのDM-HARD-8タスクでBYOL-Exploreに劣る性能を示した。
  • 予測ホライズンKが増加するにつれて性能が滑らかに向上し、多段階の将来予測が探索効率を向上させることを示した。
  • EMAの減衰係数αに対して頑健であり、最適な性能はα = 0.99で達成され、ハイパーパrameterの変更に対しても安定した学習が確認された。
  • BYOL-Exploreは、Agent57 や Go-Explore よりも単純なアーキテクチャで、10の最も難しいAtari探索ゲームで超人水準のパフォーマンスを達成した。
  • 共有パラメータとタスクごとのデータ量が制限されたマルチタスク設定でも、単一タスクのベースラインを上回った。これは、本手法のサンプル効率と一般化能力の高さを裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。