Skip to main content
QUICK REVIEW

[論文レビュー] HIGhER : Improving instruction following with Hindsight Generation for Experience Replay

Geoffrey Cideron, Mathieu Seurin|arXiv (Cornell University)|Oct 21, 2019
Reinforcement Learning in Robotics被引用数 15
ひとこと要約

HIGhERは、失敗したトラジェクトリに対して自然言語の後向き目標を生成することで強化学習における指示従いを向上させる新規手法を提案する。これにより、人的な指導なしに経験リプレイを可能にする。成功したトラジェクトリを用いて訓練されたゴールマッパーにより、失敗したトラジェクトリを意味的に整合性のある指示に再ラベル付けすることで、標準的なヒンターレアレイ(HER)と同等の性能を達成しつつ、人的なデモの必要性を排除する。

ABSTRACT

Language creates a compact representation of the world and allows the description of unlimited situations and objectives through compositionality. While these characterizations may foster instructing, conditioning or structuring interactive agent behavior, it remains an open-problem to correctly relate language understanding and reinforcement learning in even simple instruction following scenarios. This joint learning problem is alleviated through expert demonstrations, auxiliary losses, or neural inductive biases. In this paper, we propose an orthogonal approach called Hindsight Generation for Experience Replay (HIGhER) that extends the Hindsight Experience Replay (HER) approach to the language-conditioned policy setting. Whenever the agent does not fulfill its instruction, HIGhER learns to output a new directive that matches the agent trajectory, and it relabels the episode with a positive reward. To do so, HIGhER learns to map a state into an instruction by using past successful trajectories, which removes the need to have external expert interventions to relabel episodes as in vanilla HER. We show the efficiency of our approach in the BabyAI environment, and demonstrate how it complements other instruction following methods.

研究の動機と目的

  • 指示に従う強化学習における疎な報酬の課題に対処すること。これは、エージェントがタスクを完全に完了しない限りフィードバックを受けないためである。
  • 自然言語ゴールを用いる際のヒンターレアレイ(HER)において、失敗したトラジェクトリの再ラベル付けに人的なデモに依存しないこと。
  • 言語の構成性とトラジェクトリの一貫性を活用することで、言語の意味的把握とナビゲーション方策の共同学習を可能にすること。
  • 自己教師付きの後向き目標生成が、人的な指導付きHERの性能を指示従い環境で同等に達成できることを示すこと。
  • 環境との相互作用のみで、人的なデモなしに完全にスケーラブルかつ一般化可能な指示従いのアプローチを提供すること。

提案手法

  • HIGhERは、成功したトラジェクトリのみを監視として用い、最終状態から自然言語の指示を予測するゴールマッパー・ネットワークを訓練する。
  • 失敗が発生した際、実際の結果と一致する生成された指示を用いてトラジェクトリが再ラベル付けされ、正の報酬信号が得られる。
  • 再ラベル付けされたエピソードはリプレイバッファに格納され、成功したトラジェクトリに加え、意味的に妥当な再ラベル付け済みトラジェクトリからも方策が学習可能になる。
  • 空間的ゴールの再ラベル付けを言語ベースのゴール生成に置き換えることで、HERを言語ゴールに拡張し、外部の専門家を必要としない。
  • ポリシーと同時にエンドツーエンドで訓練されるゴールマッパーにより、言語理解と行動選択の共同最適化が可能になる。
  • このアプローチは、言語の構成性に依存しており、'赤い物体をどれでも取る'や'青くないボールを取りにいく'といった多様で意味のある指示を生成可能である。

実験結果

リサーチクエスチョン

  • RQ1失敗したトラジェクトリに対して、意味的に整合性のある自然言語指示を生成することで、指示従いRLにおけるサンプル効率を向上させることができるか?
  • RQ2自己教師付きの後向き目標生成は、言語条件付き環境において、人的な指導付きHERの性能にどの程度近づけるか?
  • RQ3ノイズや不完全な言語監視下において、HIGhERは標準的なRLベースラインと比較してどの程度の性能を示すか?
  • RQ4言語の構成性とトラジェクトリの一貫性を活用することで、未知の指示に一般化できるか?
  • RQ5言語の意味的把握とナビゲーション方策の共同学習は、未学習の指示に対してより優れたゼロショット一般化をもたらすか?

主な発見

  • HIGhERは、人的なデモなしに環境との相互作用のみに依存しているにもかかわらず、BabyAI環境において標準的なヒンターレアレイ(HER)と同等の性能を達成した。
  • 失敗したエピソードに対して意味のある後向き指示を生成することで、指示従いタスクにおけるサンプル複雑性を顕著に低減した。
  • HIGhERはノイズや不完全な言語監視に対して頑健であり、挑戦的な指示従いシナリオにおいて、標準的なDQNおよびHERベースラインを上回った。
  • ゴールマッパーは、観測されたトラジェクトリから'赤い物体をどれでも取る'や'青くないボールを取りにいく'といった意味的に整合性があり多様な指示を生成する能力を学習した。
  • 実験的結果から、HIGhERは言語の意味的把握とナビゲーション方策の有効な共同学習を可能にし、未学習の指示への一般化が顕著に優れていた。
  • このアプローチは言語以外のモodal(視覚言語やマルチモーダルなゴール空間など)へも一般化可能であり、将来的に視覚言語やマルチモーダルなゴール空間への応用が期待される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。