Skip to main content
QUICK REVIEW

[論文レビュー] EAGER: Asking and Answering Questions for Automatic Reward Shaping in Language-guided RL

Thomas Carta, Pierre‐Yves Oudeyer|arXiv (Cornell University)|Jun 20, 2022
Topic Modeling被引用数 5
ひとこと要約

本論文では、自然言語の目的から質問生成(QG)および質問応答(QA)を介して補助的目標を自動生成する、言語誘導強化学習手法EAGERを提案する。軌道に基づく部分的情報に関する自己生成質問を的確に回答することへの報酬を、エージェントが自信を持って回答した場合に与えることで、熟練者の干渉なしに内生的報酬を形状化し、スパarsely-rewardedで長時間にわたるタスクにおけるサンプル効率を向上させる。

ABSTRACT

Reinforcement learning (RL) in long horizon and sparse reward tasks is notoriously difficult and requires a lot of training steps. A standard solution to speed up the process is to leverage additional reward signals, shaping it to better guide the learning process. In the context of language-conditioned RL, the abstraction and generalisation properties of the language input provide opportunities for more efficient ways of shaping the reward. In this paper, we leverage this idea and propose an automated reward shaping method where the agent extracts auxiliary objectives from the general language goal. These auxiliary objectives use a question generation (QG) and question answering (QA) system: they consist of questions leading the agent to try to reconstruct partial information about the global goal using its own trajectory. When it succeeds, it receives an intrinsic reward proportional to its confidence in its answer. This incentivizes the agent to generate trajectories which unambiguously explain various aspects of the general language goal. Our experimental study shows that this approach, which does not require engineer intervention to design the auxiliary objectives, improves sample efficiency by effectively directing exploration.

研究の動機と目的

  • 長時間にわたるスパース報酬環境における言語条件付き強化学習のサンプル非効率性を解消すること。
  • 言語誘導RLにおける熟練者による補助的目標や報酬形状の必要性を排除すること。
  • 自然言語指示から質問生成を用いて、意味のある補助的目標をエージェントが自律的に生成できることを可能にすること。
  • 自己生成質問に対する回答の信頼度に基づく内生的報酬を用いて、探索性と学習効率を向上させること。
  • NLPの質問応答メトリクスにインspiredされた、参照なしで自動化された報酬形状メカニズムの開発

提案手法

  • エージェントは初期の言語目的の語をマスキングすることで質問生成(QG)モジュールを用いて質問を生成する。
  • 質問応答(QA)モジュールは、エージェントの現在の軌道からのみ状態シーケンスを用いて各質問に答える試みを行う。
  • 正解に対する回答の信頼度に比例した内生的報酬をエージェントが受ける。誤答を避けるために「答えなし」の選択肢を導入する。
  • QAモジュールは、成功した軌道のデータセット上で事前学習され、部分的な目的情報に関する質問に答える能力を学ぶ。
  • 自己生成質問のカリキュラムを用いて、言語目的の重要な側面を明確に再構築できる軌道へ探索を誘導する。
  • QAの成功確率が0.56を超える限り、QAの性能にかかわらずフレームワークは頑健であり、QAがより信頼性が高いほど学習が向上する。

実験結果

リサーチクエスチョン

  • RQ1熟練者の入力を必要とせず、自然言語の目的から有用な補助的目標をエージェントが自動的に生成できるか?
  • RQ2自己生成QAに基づく内生的報酬は、言語誘導RLにおけるサンプル効率をどのように向上させるか?
  • RQ3QAの信頼性は、EAGERフレームワークの性能にどのような影響を及ぼすか?
  • RQ4QAモジュールの設計選択(例:「答えなし」オプションや信頼度ベースの報酬)は、学習効率にどのように影響するか?
  • RQ5異なる軌道分布やQA品質を持つ環境間で、EAGERは一般化可能か?

主な発見

  • EAGERは、自己生成質問と信頼度ベースの回答を用いて内生的報酬を形状化することで、言語誘導RLにおけるサンプル効率を向上させる。
  • QAモジュールの成功確率が0.56を超えると、より速い学習が達成され、異なるQA性能レベルでも学習曲線が安定する。
  • 「答えなし」オプションと信頼度ベースの報酬を含むQAモジュールを用いたエージェントは、二値または非信頼度ベースの報酬ベースラインと比較して、顕著に高いサンプル効率を示す。
  • ノイズを加えた広範な軌道分布で学習させると、狭く決定論的な軌道分布で学習させるよりも、より速い学習が達成される。
  • アブレーションスタディの結果、『答えなし』機構と信頼度ベースの報酬の両方が、独立して学習速度と安定性を向上させることを確認した。
  • QA性能が最適でない場合でも、フレームワークは有効であり、不完全な質問応答システムに対しても頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。