Skip to main content
QUICK REVIEW

[論文レビュー] Learning Social Affordance for Human-Robot Interaction

Tianmin Shu, Michael S. Ryoo|arXiv (Cornell University)|Apr 13, 2016
Human Pose and Action Recognition参考文献 28被引用数 20
ひとこと要約

本論文では、RGB-D動画から社会的アフォーダンスを学習する弱教師付き生成モデルを提案する。マルコフ連鎖モンテカルロ法(MCMC)を用い、人間-ロボットインタラクションの文脈で、潜在的な部分イベントおよび身体関節の機能的グルーピングを同定する。本手法により、エージェント間の空間的・運動的ポテンシャルをモデル化することで、ノイズのあるスケルトンでも、キネクトの真値に匹敵する合成品質の自然で文脈に適った全身運動をロボットが推論・再現可能となる。

ABSTRACT

In this paper, we present an approach for robot learning of social affordance from human activity videos. We consider the problem in the context of human-robot interaction: Our approach learns structural representations of human-human (and human-object-human) interactions, describing how body-parts of each agent move with respect to each other and what spatial relations they should maintain to complete each sub-event (i.e., sub-goal). This enables the robot to infer its own movement in reaction to the human body motion, allowing it to naturally replicate such interactions. We introduce the representation of social affordance and propose a generative model for its weakly supervised learning from human demonstration videos. Our approach discovers critical steps (i.e., latent sub-events) in an interaction and the typical motion associated with them, learning what body-parts should be involved and how. The experimental results demonstrate that our Markov Chain Monte Carlo (MCMC) based learning algorithm automatically discovers semantically meaningful interactive affordance from RGB-D videos, which allows us to generate appropriate full body motion for an agent.

研究の動機と目的

  • 人間の行動動画から、マルチエージェント相互作用における行動可能性(アフォーダンス)を学習できるようにすること。
  • ノイズの多いスケルトン推定がある中でも、部分イベント分解や関節の運動パターンを含む、人間の相互作用の複雑な時間的ダイナミクスをモデル化すること。
  • 強い人間ラベルなしで、潜在的な部分イベントおよび機能的関節グルーピングを発見できる弱教師付き学習フレームワークを開発すること。
  • 観測された人間の運動に基づき、リアルタイムに適切な反応を推論することで、ロボットが自然で文脈に適った全身運動シーケンスを合成すること。
  • 人間の運動表現をロボットに転送し、エージェント間の空間的・運動的ポテンシャルを学習することで、自然な相互作用を可能にすること。

提案手法

  • 二重ループのMCMCアルゴリズムを用いる:外側のループはメトロポリス・フューデン採択を用いて部分イベントの時系列解析を実行し、内側のループは変更済み中国レストランプロセス(CRP)を用いて関節をグルーピングする。
  • 各部分イベント内での関節グループに空間的・運動的ポテンシャルを学習し、身体部位どうしがどのように相対的に動くべきかを捉える。
  • 社会的意味のある文脈でのみ活性化される、部分イベントに跨る関節の階層的運動パターンとして、社会的アフォーダンスを表現する。
  • ロボットをマルチエージェント相互作用の一員として扱い、観測された人間の運動に基づいて自らの運動を推論可能にする。
  • 学習されたアフォーダンスモデルを未観測なシナリオに適用し、学習済みの関節軌道とロボットの運動学的制約を照合することで、将来のスケルトンシーケンスを合成する。
  • 時間的・空間的制約を活用することで、遮蔽やノイズに強く、RGB-D動画と推定スケルトンを用いる。

実験結果

リサーチクエスチョン

  • RQ1ロボットは、構造のない人間相互作用の動画から、社会的に意味のある行動可能性(アフォーダンス)をどのように学習できるか?
  • RQ2動的関節レベルの協調と部分イベント分解を伴うマルチエージェント相互作用をモデル化するには、どのような構造的表現が必要か?
  • RQ3弱教師付き学習アプローチは、ノイズが多く限られた人間のデモンストレーションデータから、潜在的な部分イベントおよび機能的関節グルーピングをどのように発見できるか?
  • RQ4学習された社会的アフォーダンスは、どれほど真値の人間の運動と見分けがつかない運動シーケンスを生成できるか?
  • RQ5ロボットは、学習済みのアフォーダンス表現に基づき、人間の運動に対してリアルタイムで適切な反応を推論・実行できるか?

主な発見

  • MCMCに基づく学習アルゴリズムは、ノイズのあるスケルトンを伴うRGB-D動画から、意味的に適切な部分イベントおよび機能的関節グルーピングを成功裏に発見した。
  • 合成された運動シーケンスは、人間による評価でキネクトの真値と同等の水準に達し、特にQ1およびQ2の「手を振る」および「投げて受け取る」において、真値を上回る平均評価を得た。
  • Q1において、「手を振る」の87%、および「投げて受け取る」の84%が、合成シーケンスで4以上(満足度5段階)の評価を得ており、高い知覚的品質を示した。
  • 接触の正確性において、特に遮蔽状態でキネクトが接触を捉えられない場合に、学習済みの関節グルーピングのおかげで真値を上回った。
  • 本手法は未観測の相互作用に対しても良好に一般化でき、90%信頼水準で、大多数の相互作用において真値と差がないと等価性検定で示された。
  • ノイズに強く、手の接触といった人間の自然な相互作用を認識する上で重要な社会的キューを捉えた運動合成を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。