[論文レビュー] RIDE: Rewarding Impact-Driven Exploration for Procedurally-Generated Environments
RIDE は、学習された状態表現に影響を与える行動を報酬する内発的報酬を導入し、手続き的に生成された疎な報酬環境での探索を改善します。ミニGridタスクで従来の内発的報酬よりも優れており、多様な迷路に対して一般化します。
Exploration in sparse reward environments remains one of the key challenges of model-free reinforcement learning. Instead of solely relying on extrinsic rewards provided by the environment, many state-of-the-art methods use intrinsic rewards to encourage exploration. However, we show that existing methods fall short in procedurally-generated environments where an agent is unlikely to visit a state more than once. We propose a novel type of intrinsic reward which encourages the agent to take actions that lead to significant changes in its learned state representation. We evaluate our method on multiple challenging procedurally-generated tasks in MiniGrid, as well as on tasks with high-dimensional observations used in prior work. Our experiments demonstrate that this approach is more sample efficient than existing exploration methods, particularly for procedurally-generated MiniGrid environments. Furthermore, we analyze the learned behavior as well as the intrinsic reward received by our agent. In contrast to previous approaches, our intrinsic reward does not diminish during the course of training and it rewards the agent substantially more for interacting with objects that it can control.
研究の動機と目的
- 疎な報酬で手続き的に生成される環境における探索を動機づける。 extrinsic rewards がまれな状況。
- 単なる新規性ではなく、影響力のある状態変化を対象とする内発的報酬を開発する。
- 報酬を環境の制御可能な側面に grounding するために forward および inverse dynamics を用いて状態表現を学習する。
- varied MiniGrid タスクおよび高次元の singleton 環境に対して RIDE を標準および内発的探索ベースラインと比較評価する。
提案手法
- Pathak ら (2017) に倣い forward および inverse dynamics モデルを用いて潜在状態表現 φ(s) を学習する。
- 内発的報酬 R_IDE = ||φ(s_{t+1}) - φ(s_t)||_2 を sqrt(N_ep(s_{t+1})) で除したもので、影響力のある遷移を報酬し、単純な前後移動を抑制する。
- RL 目的関数 L_RL と共に loss L_fw および L_inv で forward/inverse モデルを学習し、RL の更新が表現ネットワークに影響を与えないようにする。
- 内発的報酬を割引くためにエピソードごとの状態訪問回数を用いて認識的基盤を確立し、報酬が環境の制御可能な変化に焦点を当て続けるようにする。
- 埋め込みネットワークをポリシー更新から分離した状態で内発的報酬の上にポリシー学習を grounding し、報酬をいじってしまうことを防ぐ。
実験結果
リサーチクエスチョン
- RQ1学習済み潜在空間の影響に基づく内発的報酬は、手続き的に生成される疎な報酬RLタスクにおける探索を改善できるか。
- RQ2RIDE は MiniGrid および高次元 singleton タスクにおけるサンプル効率とタスク解法性の点で、カウントベースおよび好奇心ベースの内発的報酬とどのように比較されるか。
- RQ3学習された表現は、エージェントが制御できるオブジェクトと相互作用する行動に報酬を集中させ、報酬信号は学習を通じて持続するか。
- RQ4RIDE は先行する内発的動機付け手法より手続き的に生成される環境へ一般化できるか。
主な発見
- RIDE は challenging MiniGrid タスクにおいてベースライン探索方法(Count、RND、ICM)および標準 RL(IMPALA)を上回り、他より難しい環境を解く。
- RIDE の内発的報酬は動的なままで、100M フレームを超えて減少しない。curiosity ベースやカウントベースのボーナスと異なる。
- RIDE はオブジェクトと制御可能な相互作用(例: ドアを開ける)に関与する行動を、一般的な移動よりも強調する。これは内発的報酬分析から示される。
- 手続き的に生成された迷路での訓練は singleton 迷路での訓練より広範な探索を促し、環境インスタンス間の一般化を示唆する。
- singleton VizDoom および Mario のベンチマークにおいて RIDE はベースラインと同等またはそれ以上の性能を示す一方、外部報酬と組み合わせた場合好奇心ベースの手法は学習を妨げることがある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。