Skip to main content
QUICK REVIEW

[論文レビュー] Disentangled Relational Representations for Explaining and Learning from Demonstration

Yordan Hristov, Daniel Angelov|arXiv (Cornell University)|Jul 31, 2019
Explainable Artificial Intelligence (XAI)被引用数 10
ひとこと要約

本稿では、変分オートエンコーダに補助損失を組み合わせることで、高次元の感覚データに抽象的な空間的概念(例:'左に'、'上に')を埋め込む、分離可能な関係表現学習フレームワークを提案する。分離性と人間の一般的な常識的認識の整合性を最適化することで、模倣学習からの解釈可能な記号的計画立案と正確なエンドエフェクターポーズ予測を可能にし、フォトリッチな環境および現実世界のロボット操作タスクにおいても高い性能を示した。

ABSTRACT

Learning from demonstration is an effective method for human users to instruct desired robot behaviour. However, for most non-trivial tasks of practical interest, efficient learning from demonstration depends crucially on inductive bias in the chosen structure for rewards/costs and policies. We address the case where this inductive bias comes from an exchange with a human user. We propose a method in which a learning agent utilizes the information bottleneck layer of a high-parameter variational neural model, with auxiliary loss terms, in order to ground abstract concepts such as spatial relations. The concepts are referred to in natural language instructions and are manifested in the high-dimensional sensory input stream the agent receives from the world. We evaluate the properties of the latent space of the learned model in a photorealistic synthetic environment and particularly focus on examining its usability for downstream tasks. Additionally, through a series of controlled table-top manipulation experiments, we demonstrate that the learned manifold can be used to ground demonstrations as symbolic plans, which can then be executed on a PR2 robot.

研究の動機と目的

  • ロボットが人間の模倣学習と自然言語の指示を用いて空間的関係を学習・推論できるようにすること。
  • 抽象的な言語的記号(例:'左に'、'上に')を低レベルの感覚観測に根拠づける挑戦に、分離可能な表現を用いて対処すること。
  • 人間にとって解釈可能なだけでなく、記号的計画の推論や行動実行といった後続のロボットタスクに有用な潜在空間を構築すること。
  • 合成的および現実世界の設定の両方でフレームワークを評価し、遮蔽やタスク間の一般化に対する耐性を示すこと。

提案手法

  • 高次元の視覚的観測を低次元で解釈可能な多様体にマップする、分離可能な潜在空間を備えた深層変分オートエンコーダを用いる。
  • 再構成損失と関係的対照的損失という2つの補助損失を導入し、空間的関係(例:左/右、前/後ろ)の分離性を強制する。
  • 物体ラベルと関係的概念を予測する別個の分類器ヘッドを採用し、分離性が人間が解釈可能な空間的関係に明示的に最適化されることを保証する。
  • 時間的クラスタリングと記号の根拠づけに基づく計画セグメンテーションモジュールを用いて、第三人称視点の模倣学習から記号的計画を推論する。
  • 推論された記号的計画を回帰ヘッドを介してエンドエフェクターポーズにマッピングし、PR2ロボットでの実行を可能にする。
  • フォトリッチな合成環境(ブロックワールド)で学習し、PR2ロボットの遠隔操作データを用いて微調整する。

実験結果

リサーチクエスチョン

  • RQ1深層生成モデルは、生の感覚入力と弱い人間のアノテーションから、分離可能で人間が解釈可能な対象間空間的関係の表現を学習できるか?
  • RQ2学習された潜在空間は、非構造化された模倣学習から記号的計画の推論にどの程度寄与できるか?
  • RQ3根拠づけられた記号的計画は、ロボットタスク実行のための正確なエンドエフェクタートレジェリーをどの程度正確に予測できるか?
  • RQ4補助損失による分離性の強制は、計画セグメンテーションやポーズ予測といった後続タスクの耐性および正確性を向上させるか?

主な発見

  • 再構成損失と関係的対照的損失の両方を組み合わせたモデルは、計画セグメンテーションで最高のパフォーマンスを達成し、繰り返しの模倣では100%、連結された模倣では90%の正確性を示した。
  • 学習された潜在空間により、より多くの模倣学習が観測されるにつれて、編集距離が真値に近づく信頼性の高い記号的計画の推論が可能になった。特にマルチステップタスクにおいて顕著であった。
  • 推論された記号的計画を用いてエンドエフェクターポーズを予測したところ、平均絶対誤差は、'上に置く'タスクで0.04 m、'カップを向ける'タスクで0.05 m、'中に置く'タスクで0.03 mと低く抑えられた。
  • モデルはタスク固有のポーズ回帰を学習し、タスク成功に寄与する軸(例:配置タスクではX/Y/Z、姿勢タスクではRoll/Pitch)において低い誤差を示した。
  • 分離可能な表現は、互いに排他的な空間的関係(例:左/右 vs. 前/後ろ)を的確に捉えており、人間の一般的な常識と整合していた。
  • 遮蔽がある状況下でも、分離可能な潜在空間の頑健さを活かして、未観測の模倣学習への一般化を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。