Skip to main content
QUICK REVIEW

[論文レビュー] PixL2R: Guiding Reinforcement Learning Using Natural Language by Mapping Pixels to Rewards

Prasoon Goyal, Scott Niekum|arXiv (Cornell University)|Jul 30, 2020
Reinforcement Learning in Robotics参考文献 33被引用数 12
ひとこと要約

この論文では、ペaired (トラジェクトリ、言語) データ上で訓練された教師ありモデルを用いて、生のピクセル観測を言語条件付き報酬にマップするPixL2Rという手法を提案する。自由形式の自然言語記述から中間報酬を生成することにより、メタワールドのロボット操作ベンチマークにおいてスパarselyとdenseな報酬設定の両方で、サンプル効率が顕著に向上する。

ABSTRACT

Reinforcement learning (RL), particularly in sparse reward settings, often requires prohibitively large numbers of interactions with the environment, thereby limiting its applicability to complex problems. To address this, several prior approaches have used natural language to guide the agent's exploration. However, these approaches typically operate on structured representations of the environment, and/or assume some structure in the natural language commands. In this work, we propose a model that directly maps pixels to rewards, given a free-form natural language description of the task, which can then be used for policy learning. Our experiments on the Meta-World robot manipulation domain show that language-based rewards significantly improves the sample efficiency of policy learning, both in sparse and dense reward settings.

研究の動機と目的

  • 報酬が得られるまでの期間が長く、ゴールに到達するまで学習信号を受けないスパース報酬環境において顕著に顕著なサンプル非効率性が生じる強化学習の課題に対処すること。
  • 事前に定義された言語的構造や環境の構造的表現を必要とする先行の言語ガイドド強化学習手法の制限を克服すること。
  • 手作業で設計された報酬関数や環境ダイナミクスに依存せずに、自由形式の自然言語記述を用いて効率的なポリシー学習を可能にすること。
  • 視覚的観測(ピクセル)を自然言語タスク記述に条件づけた報酬に直接マップする汎用性の高いフレームワークを開発すること。
  • 手作業で設計されたdense報酬の補完または強化として、言語ベースの報酬を用いることでポリシー学習の効率を向上させること。

提案手法

  • トラジェクトリと言語のペアデータ上で、トラジェクトリと言語の両方のエンコーダーを備えたシアンズ型アーキテクチャを用いて、教師あり関係性モデルであるPixL2Rを訓練する。
  • CNN-LSTMアーキテクチャを用いて、連続するRGBフレームから空間的・時間的ダイナミクスを捉えるためにトラジェクトリをエンコードする。
  • LSTMを用いて、テキスト内の順序的依存関係をモデル化することで、自然言語記述をエンコードする。
  • マルチレイヤーパーセプトロンを介して、トラジェクトリと言語の埋め込み間の類似度スコアを計算し、これが言語条件付き報酬として機能する。
  • 訓練済みのPixL2Rモデルを、標準的な強化学習設定においてポリシー学習中に中間報酬を生成するために使用する。この際、言語記述を入力として用いる。
  • ポリシー学習中に収集したトラジェクトリを用いてPixL2Rモデルをファインチューニングし、実際のタスク進行状況との整合性を高める。

実験結果

リサーチクエスチョン

  • RQ1連続制御タスクにおいて、生のピクセル観測から自由形式の自然言語記述を用いて中間報酬を効果的に生成できるか?
  • RQ2手作業で設計されたdense報酬と比較して、言語条件付き報酬設計はポリシー学習のサンプル効率においてどのように異なるか?
  • RQ3事前学習中に観測されていない新しいオブジェクト-アクションの組み合わせを含む新規タスクに対して、モデルはどの程度一般化できるか?
  • RQ4トラジェクトリエンコーディング、言語エンコーディング、および入力モality(例:単一視点対複数視点)の変化に対して、このアプローチはどの程度頑健か?
  • RQ5タスク完了まで内部報酬信号が得られないスパース報酬設定において、言語ベースの報酬は学習を改善できるか?

主な発見

  • PixL2Rは、メタワールドベンチマークにおいて、スパースおよびdenseな報酬設定の両方で、成功エピソード数の観点から手作業で設計されたdense報酬を上回る顕著なサンプル効率の向上を達成した。
  • トラジェクトリの最後のフレーム(LastFrame)を用いる、または言語埋め込みを平均プーリングする(MeanpoolLang)という簡略化手法を用いても、stillにdense報酬を上回る統計的に有意な改善が得られた。これは、モデルの簡略化に対して高い頑健性を示している。
  • LSTMベースのトラジェクトリエンコーダーを平均プーリングに置き換える(MeanpoolTraj)と、性能が著しく低下した。これは、トラジェクトリ理解において時間的順序の重要性を確認している。
  • 単一カメラビューを用いる(SingleView)と、dense報酬を上回る小さな改善が得られたが、有意ではなかった。これは、複数視点が視覚的アリヤスや遮蔽を緩和するのに寄与していることを示している。
  • 回帰損失を分類損失に置き換える(Dense+CLS)と、統計的に有意な改善が得られなかった。これは、回帰目的が部分的な進行状況をより適切に捉えていることを示している。
  • アブレーションスタディの結果、モデルはトラジェクトリおよび言語の両方から意味のある情報を抽出しており、性能はドメインや入力モダリティに強く依存していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。