Skip to main content
QUICK REVIEW

[論文レビュー] Learning Representations that Enable Generalization in Assistive Tasks

Jerry Zhi-Yang He, Aditi Raghunathan|arXiv (Cornell University)|Dec 5, 2022
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、相互作用履歴から直接人間パートナーポリシーの分離済み潜在表現を学習するPALM(Prediction-based Assistive Latent eMbedding)というフレームワークを提案する。このフレームワークにより、アシストロボティクスにおけるゼロショット一般化が向上する。潜在空間を人間の行動を予測するように訓練し、観察された行動を用いてテスト時における適応を可能にすることで、最先端の sim2real および人間-ロボットインタラクション手法と比較して、分布外(OOD)の人間ポリシーに対する優れた一般化性能を達成する。

ABSTRACT

Recent work in sim2real has successfully enabled robots to act in physical environments by training in simulation with a diverse ''population'' of environments (i.e. domain randomization). In this work, we focus on enabling generalization in assistive tasks: tasks in which the robot is acting to assist a user (e.g. helping someone with motor impairments with bathing or with scratching an itch). Such tasks are particularly interesting relative to prior sim2real successes because the environment now contains a human who is also acting. This complicates the problem because the diversity of human users (instead of merely physical environment parameters) is more difficult to capture in a population, thus increasing the likelihood of encountering out-of-distribution (OOD) human policies at test time. We advocate that generalization to such OOD policies benefits from (1) learning a good latent representation for human policies that test-time humans can accurately be mapped to, and (2) making that representation adaptable with test-time interaction data, instead of relying on it to perfectly capture the space of human policies based on the simulated population only. We study how to best learn such a representation by evaluating on purposefully constructed OOD test policies. We find that sim2real methods that encode environment (or population) parameters and work well in tasks that robots do in isolation, do not work well in assistance. In assistance, it seems crucial to train the representation based on the history of interaction directly, because that is what the robot will have access to at test time. Further, training these representations to then predict human actions not only gives them better structure, but also enables them to be fine-tuned at test-time, when the robot observes the partner act. https://adaptive-caregiver.github.io.

研究の動機と目的

  • 訓練集団とは異なる分布外(OOD)の人間パートナーがテスト時に登場するアシストロボティクスにおける一般化の課題に対処すること。
  • 環境パrameter や報酬などの間接的信号ではなく、相互作用履歴に基づいて構造的かつ適応可能な人間ポリシーの潜在空間を学習するフレームワークを設計すること。
  • 実際の相互作用データを用いてテスト時における潜在空間の適応を可能にし、OODの人間行動に対するロバストネスを向上させること。
  • 制御されたOOD焦点型のアシストタスク設定において、表現学習手法を評価・比較すること。

提案手法

  • フレームワークは、エンドツーエンドのバックプロパゲーションを用いてロボットポリシーと潜在埋め込み空間を同時に訓練する。潜在空間は、相互作用履歴から人間の行動を予測するように訓練される。
  • 潜在空間はコントラスト型目的関数とKL正則化項を用いて最適化され、滑らかで一般化可能な構造を促進する。
  • テスト時適応は、相互作用中に観察された人間の行動を用いて潜在空間をファインチューニングすることで実現され、新しいパートナーとの動的整合性が可能になる。
  • 本手法は二重ストリームアーキテクチャを採用している。一方のストリームは人間の履歴をエンコードし、もう一方は次の行動を予測する。潜在コードが共有表現として機能する。
  • フレームワークは、2次元の到達環境と、多様な人間ポリシーを持つ2次元のかゆみかくしタスクの2つのシミュレーテッドアシストタスクで評価されている。
  • 人間ポリシーは明示的にOODとなるように構築されており、一般化性能の制御された評価が可能になる。

実験結果

リサーチクエスチョン

  • RQ1環境パrameter や間接的信号(例:報酬)に基づく表現と比較して、相互作用履歴から学習した人間ポリシーの潜在表現が、OODの人間行動に対してより優れた一般化を達成できるか?
  • RQ2訓練時に人間の行動を予測することで、状態や報酬を予測する場合と比較して、より構造的かつ一般化可能な潜在空間が得られるか?
  • RQ3学習済み潜在空間のテスト時適応が、未確認の人間パートナーにおける性能向上にどの程度寄与するか?
  • RQ4表現学習目的関数の選択(例:行動予測対報酬予測)が、アシストタスクにおける一般化に与える影響は何か?

主な発見

  • PALMは行動予測を用いることで、到達タスクおよびかゆみかくしタスクの両方において、RMA、RNN、LILI、RILIを含むすべてのベースラインを上回る一般化性能を達成する。
  • 行動予測を用いて学習された潜在空間は、人間ポリシーの背後にある輪状構造を効果的に捉えている。一方、RMA や RILI は曖昧または情報のない信号に依存しているため、この構造を保持できていない。
  • KL正則化により、より滑らかな潜在分布が得られ、OODの人間が分布の欠落領域に適切に埋め込まれやすくなる。これは、一般化性能の向上に寄与する。
  • テスト時適応は性能向上に顕著な効果を示し、潜在空間の可視化から、PALMの潜在空間が分布のギャップを埋める形でOODの人間をよりよく埋め込んでいることが示されている。
  • 報酬や状態を予測するベースラインは、人間ポリシー間の構造的関係を捉えられていないため、一般化性能が低い。
  • 人間分布がより複雑になっても、本手法はMLP や RILI と比較して優れた性能を示す。特に分布の複雑さが増すと、MLP や RILI は性能を著しく低下させる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。