Skip to main content
QUICK REVIEW

[論文レビュー] Grounding Language to Autonomously-Acquired Skills via Goal Generation

Ahmed Akakzia, Cédric Colas|arXiv (Cornell University)|Jun 12, 2020
Reinforcement Learning in Robotics参考文献 37被引用数 15
ひとこと要約

本論文は、空間的関係の間接的意味的表現を通じて、内発的動機付けによるスキル学習と言語の意味的基盤を分離する、言語-目的-行動(LGB)アーキテクチャを提案する。エージェントが意味的目標を自律的になし、条件付き変分オートエンコーダ(c-VAE)を用いてそれらを言語命令から生成することで、同じ指示に対して多様で戦略を切り替え可能な行動を可能にする。この手法は、より優れた意味的基盤とスケーラビリティを示す、エンドツーエンド手法と比較して優れた性能を示した、操作環境で検証された。

ABSTRACT

We are interested in the autonomous acquisition of repertoires of skills. Language-conditioned reinforcement learning (LC-RL) approaches are great tools in this quest, as they allow to express abstract goals as sets of constraints on the states. However, most LC-RL agents are not autonomous and cannot learn without external instructions and feedback. Besides, their direct language condition cannot account for the goal-directed behavior of pre-verbal infants and strongly limits the expression of behavioral diversity for a given language input. To resolve these issues, we propose a new conceptual approach to language-conditioned RL: the Language-Goal-Behavior architecture (LGB). LGB decouples skill learning and language grounding via an intermediate semantic representation of the world. To showcase the properties of LGB, we present a specific implementation called DECSTR. DECSTR is an intrinsically motivated learning agent endowed with an innate semantic representation describing spatial relations between physical objects. In a first stage (G -> B), it freely explores its environment and targets self-generated semantic configurations. In a second stage (L -> G), it trains a language-conditioned goal generator to generate semantic goals that match the constraints expressed in language-based inputs. We showcase the additional properties of LGB w.r.t. both an end-to-end LC-RL approach and a similar approach leveraging non-semantic, continuous intermediate representations. Intermediate semantic representations help satisfy language commands in a diversity of ways, enable strategy switching after a failure and facilitate language grounding.

研究の動機と目的

  • エンドツーエンドの言語条件付き強化学習(LC-RL)の制限を解消すること。これは、スキル学習と言語の意味的基盤を結合しており、行動の多様性を制限する。
  • 外部の報酬や指示なしに、内発的動機付けと自己教師学習を用いてスキルを獲得すること。これは、言語を発する前の乳児の発達を模倣する。
  • 単一の言語指示から複数の妥当な意味的目標構成を生成可能にし、戦略の切り替えと失敗に強い耐性を実現すること。
  • 意味的中間表現が、連続的または非意味的表現と比較して、言語の意味的基盤の効率性とスケーラビリティを向上させることを示すこと。

提案手法

  • エージェントは、物体中心のインダクティブバイアスと、事前に定義された空間述語(例:赤いブロックが緑のブロックの上にある)のセットを用いて、物理的物体の意味的構成を表現する。
  • スキル学習フェーズ(g → b)では、エージェントが内発的好奇心を用いて自律的探索を行い、自己生成された意味的構成を標的とする。報酬は、目標到達可能性に基づいて形状される。
  • 言語の意味的基盤フェーズ(l → g)では、自然言語指示を一致する意味的目標構成にマッピングするための条件付き変分オートエンコーダ(c-VAE)を訓練する。
  • 2つのフェーズを組み合わせる:意味的目標を学習した後、c-VAEを用いて言語から目標を生成し、指示従い行動を可能にする。
  • 意味的表現空間は関係述語によって定義され、物理的状態の抽象化を可能にし、手作業によるカリキュラムの必要性を低減する。
  • グラフニューラルネットワークとディープセットを用いて、可変サイズの入力をサポートすることで、動的オブジェクト集合へのスケーラビリティを実現する。

実験結果

リサーチクエスチョン

  • RQ1エージェントは、外部の報酬や指示なしに、内発的動機付けと意味的目標表現のみを用いて、スキルのレパートリーを自律的に学習できるか?
  • RQ2スキル学習と言語の意味的基盤を分離することで、エンドツーエンドのLC-RLと比較して、同じ言語指示に対してより高い行動の多様性が達成できるか?
  • RQ3失敗後に、単一の指示から複数の妥当な目標構成を生成することで、戦略の切り替えが可能になるか?
  • RQ4意味的表現が、連続的または非意味的中間表現と比較して、言語の意味的基盤の効率性とスケーラビリティに与える影響は何か?

主な発見

  • decstrエージェントは、内発的動機付けと物体中心のインダクティブバイアスを用いて、操作環境で到達可能なすべての意味的構成を自律的に発見・習得した。
  • c-VAEベースの目標生成器は、有効な言語の意味的基盤を達成し、単一の指示から複数の妥当な意味的構成を生成することで、行動の多様性を実現した。
  • エージェントは、失敗後に同じ言語命令に一致する代替の目標構成を生成することで、戦略の切り替えを示した。
  • 意味的表現は、手作業によるカリキュラムや複雑な好奇心メカニズムの必要性を低減し、ブロック操作タスクにおけるスキル習得を簡素化した。
  • エンドツーエンドのLC-RLと比較して、行動の多様性と耐性の面で優れた性能を示した。これは、1つの指示から複数の妥当な行動を生成できることに起因する。
  • 述語ベースの意味的表現により、効率的な意味的基盤が可能になり、新しい文や未知の初期状態への一般化を促進した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。