Skip to main content
QUICK REVIEW

[論文レビュー] Learning Social Affordance Grammar from Videos: Transferring Human Interactions to Human-Robot Interactions

Tianmin Shu, Xiaofeng Gao|arXiv (Cornell University)|Mar 1, 2017
Human Pose and Action Recognition被引用数 6
ひとこと要約

本稿では、人間の相互作用のRGB-D動画から弱教師付きフレームワークを提案し、時間的・空間的AND-ORグラフ(ST-AOG)として社会的アフォーダンス文法を学習することで、人間-ロボットインタラクション(HRI)におけるリアルタイムな運動推論を実現する。この手法は、ギブスサンプリングを用いて階層的で長期的な共同タスクと短期的な原子的行動を学習し、未学習のシナリオにおいても人間らしい行動をBaxterロボットに効果的に転送する。従来手法と比較して、より現実的で適応性に優れた性能を達成した。

ABSTRACT

In this paper, we present a general framework for learning social affordance grammar as a spatiotemporal AND-OR graph (ST-AOG) from RGB-D videos of human interactions, and transfer the grammar to humanoids to enable a real-time motion inference for human-robot interaction (HRI). Based on Gibbs sampling, our weakly supervised grammar learning can automatically construct a hierarchical representation of an interaction with long-term joint sub-tasks of both agents and short term atomic actions of individual agents. Based on a new RGB-D video dataset with rich instances of human interactions, our experiments of Baxter simulation, human evaluation, and real Baxter test demonstrate that the model learned from limited training data successfully generates human-like behaviors in unseen scenarios and outperforms both baselines.

研究の動機と目的

  • 人間の相互作用動画から一般化可能な社会的アフォーダンス文法のフレームワークを構築し、自然な人間-ロボットインタラクションを支援すること。
  • ロボットのタスクプランニングにおける社会的ルールの欠如を解消し、社会的マナー、協働、支援行動をエンコードすること。
  • 学習した文法を未学習の相互作用シナリオに転送することで、人間型のロボットのリアルタイムな運動推論を可能にすること。
  • 長期的な共同サブゴールと短期的な個別行動の両方をモデル化することで、ロボット行動の現実性と適応性を向上させること。
  • 従来の研究が硬直的な表現に依存するか、新しい状況への一般化に失敗するという限界を克服すること。

提案手法

  • 社会的アフォーダンスを、階層的なサブタスクと詳細な運動の根拠(例:ジェスチャー、向きの方向)をエンコードする時間的・空間的AND-ORグラフ(ST-AOG)として表現する。
  • RGB-D動画から抽出したノイズの多い人間の骨格データを弱教師付き学習に用い、ギブスサンプリングによりエンドツーエンドの文法構築を可能にする。
  • 時間的・空間的制約を伴う共同サブタスク(例:手を繋ぐ)と個別原子的行動(例:腕を挙上する)を通じて相互作用をモデル化する。
  • 学習済みのST-AOGからパースグラフをサンプリングすることで、リアルタイムな運動推論を実現し、5 fpsで人間らしいロボットの運動を生成する。
  • 実世界の展開において、Kinectの骨格ノイズに対処するため、ロボットの手に圧力センサを統合し、握りの関係を検出する。
  • 直接マッピングと逆運動学を用いて、人間の関節角度をBaxterロボットの運動学に変換することで、構造的差異がある中でも運動を転送可能にする。

実験結果

リサーチクエスチョン

  • RQ1未構造化された人間の相互作用のRGB-D動画から、弱教師付きで社会的アフォーダンス文法をどのように学習できるか?
  • RQ2階層的な時間的・空間的文法(ST-AOG)は、人間の相互作用における長期的な共同サブゴールと短期的な個別行動の両方を効果的に表現できるか?
  • RQ3学習した文法は、未学習の相互作用シナリオにどの程度一般化可能であり、現実的なロボット行動を可能にするか?
  • RQ4ST-AOGに基づくリアルタイムな運動推論は、従来手法と比較して、運動の現実性とタスク成功確率においてどのように優れているか?
  • RQ5センサ統合(例:圧力センサ)により、実世界のHRIにおけるノイズの多い骨格追跡への耐性が向上するか?

主な発見

  • 本手法は、ロボットと実際の人間の骨格間の平均関節角度差が、従来手法と比較して顕著に低く抑えられ、より人間らしい腕のジェスチャーを示した。
  • 人間評価では、本手法は平均スコア(Q1:4.3、Q2:4.2)が従来手法を上回り、標準偏差も低く、一貫性があり自然な行動を示した。
  • 高太鼓や手渡しといった相互作用で、訓練データとは異なるポーズ(例:座っている vs 立っている)の状況でも、ロボットは正常に動作した。
  • リアルタイムな運動推論システムは5 fpsで動作し、オンライン相互作用が可能であった。一方、従来手法B2は1回の計画に10秒以上を要し、オフラインでの評価に限られていた。
  • ロボットの手に圧力センサを統合することで、手を繋ぐ関係の検出が向上し、Kinectのノイズに対する耐性が向上した。
  • ST-AOGモデルは、潜在的なサブゴール(例:相互に手を繋ぐ)を効果的に捉え、新しいシナリオへの適応を可能にした。これにより、硬直的な表現や単純なIKベースラインを上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。