Skip to main content
QUICK REVIEW

[論文レビュー] Learning Human Activities and Object Affordances from RGB-D Videos

Hema Swetha Koppula, Rudhir Gupta|arXiv (Cornell University)|Oct 4, 2012
Human Pose and Action Recognition参考文献 68被引用数 5
ひとこと要約

本論文は、RGB-D動画から人間の部分的行動と物体の使用可能性(アフォーダンス)を推論するために、構造的SVMを用いたマークフ・ランダムフィールド(MRF)を組み合わせた共同学習フレームワークを提案する。時間的セグメンテーションを潜在変数としてモデル化することで、新規に構築された120本の動画から成るデータセット上において、79.4%のアフォーダンス正解率、63.4%の部分的行動正解率、75.0%の高レベル行動正解率を達成し、PR2ロボットが推論されたアフォーダンスを用いて支援的タスクを実行可能となる。

ABSTRACT

Understanding human activities and object affordances are two very important skills, especially for personal robots which operate in human environments. In this work, we consider the problem of extracting a descriptive labeling of the sequence of sub-activities being performed by a human, and more importantly, of their interactions with the objects in the form of associated affordances. Given a RGB-D video, we jointly model the human activities and object affordances as a Markov random field where the nodes represent objects and sub-activities, and the edges represent the relationships between object affordances, their relations with sub-activities, and their evolution over time. We formulate the learning problem using a structural support vector machine (SSVM) approach, where labelings over various alternate temporal segmentations are considered as latent variables. We tested our method on a challenging dataset comprising 120 activity videos collected from 4 subjects, and obtained an accuracy of 79.4% for affordance, 63.4% for sub-activity and 75.0% for high-level activity labeling. We then demonstrate the use of such descriptive labeling in performing assistive tasks by a PR2 robot.

研究の動機と目的

  • 日常環境における複雑で長時間にわたる人間の行動を、個人用ロボットが理解できるようにすること。
  • RGB-D動画シーケンスから部分的行動と物体のアフォーダンス(例:注げる、動かせる)を同時に認識すること。
  • 複数の時間的セグメンテーションを潜在変数として扱うことにより、時間的セグメンテーションの不確実性を効果的にモデル化すること。
  • 観察された人間の行動から物体の使用法を推論可能にすることで、ロボット支援の質を向上させること。
  • 学習したアフォーダンスが、トレーニング時に見られなかった高レベルの行動や現実世界の操作タスクへ一般化できることを示すこと。

提案手法

  • 部分的行動と物体、およびそれらの相互作用と時間的変化をノードとエッジとして持つマークフ・ランダムフィールド(MRF)として、人間行動とアフォーダンス認識を定式化する。
  • ラベル付けを複数の時間的セグメンテーションにわたって潜在変数として扱い、モデルパラメータを構造的サポートベクターマシン(SSVM)を用いて学習する。
  • RGB-Dデータを用いて人間のポーズと物体の幾何を頑健に推定し、部分的行動とアフォーダンスの検出を信頼性高く実現する。
  • MRF構造に物体同士の相互作用、物体と部分的行動の関係、時間的ダイナミクスを統合し、文脈的依存性をモデル化する。
  • 複数のセグメンテーションの計算複雑性に対処するため、サンプリングに基づく近似を用いた推論を適用する。
  • 4名の被験者から得た120本の動画を含む新規データセット(CAD-120)を用いてモデルを検証し、推論されたアフォーダンスを用いたロボットタスク実行を示す。

実験結果

リサーチクエスチョン

  • RQ1部分的行動と物体のアフォーダンスを共同でモデル化することで、長時間にわたる人間行動の認識精度が向上するか?
  • RQ2RGB-D動画理解において、時間的セグメンテーションの不確実性はどのように効果的にモデル化できるか?
  • RQ3推論された物体のアフォーダンスは、支援的タスクにおけるより意味のあるロボット操作を可能にするか?
  • RQ4モデルは、トレーニング時に見られなかった高レベルの行動に一般化できるか?
  • RQ5複数観測による推論は、注ぐような複雑な行動のアフォーダンス検出をどのように改善するか?

主な発見

  • 本手法は、CAD-120データセットの未観測被験者から、79.4%の物体アフォーダンス予測正解率を達成した。
  • 同じテストセットにおいて、部分的行動認識の正解率は63.4%に達し、個人差への頑健性が示された。
  • 高レベル行動ラベル付けの正解率は75.0%に達し、複雑で多段階的な行動の認識が有効に行えることが示された。
  • PR2ロボットは、推論された「動かせる」アフォーダンスを用いて、物体移動タスクを100%の正解率で実行した。
  • 液体を傾けない制約付きの移動タスクでは、複数観測によるアフォーダンス推論を適用することで、正解率が80%から100%に向上した。
  • モデルは良好に一般化可能である:トレーニング時に見られなかった2つの高レベル行動においても、アフォーダンスを正しく認識し、操作を実行できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。