Skip to main content
QUICK REVIEW

[論文レビュー] First Person Action-Object Detection with EgoNet

Gedas Bertasius, Hyun Soo Park|arXiv (Cornell University)|Mar 15, 2016
Human Pose and Action Recognition参考文献 58被引用数 16
ひとこと要約

本論文では、第一人称RGBD動画から意識的な視覚的または触覚的相互作用に関与するオブジェクト(アクションオブジェクト)を検出するための二ストリームディープラーニングモデル、EgoNetを提案する。視覚的外観と3次元空間的特徴を第一人称座標埋め込みと統合することで、最先端の性能と多様な第一人称データセットにおける強力なゼロショット一般化性能を達成した。

ABSTRACT

Unlike traditional third-person cameras mounted on robots, a first-person camera, captures a person's visual sensorimotor object interactions from up close. In this paper, we study the tight interplay between our momentary visual attention and motor action with objects from a first-person camera. We propose a concept of action-objects---the objects that capture person's conscious visual (watching a TV) or tactile (taking a cup) interactions. Action-objects may be task-dependent but since many tasks share common person-object spatial configurations, action-objects exhibit a characteristic 3D spatial distance and orientation with respect to the person. We design a predictive model that detects action-objects using EgoNet, a joint two-stream network that holistically integrates visual appearance (RGB) and 3D spatial layout (depth and height) cues to predict per-pixel likelihood of action-objects. Our network also incorporates a first-person coordinate embedding, which is designed to learn a spatial distribution of the action-objects in the first-person data. We demonstrate EgoNet's predictive power, by showing that it consistently outperforms previous baseline approaches. Furthermore, EgoNet also exhibits a strong generalization ability, i.e., it predicts semantically meaningful objects in novel first-person datasets. Our method's ability to effectively detect action-objects could be used to improve robots' understanding of human-object interactions.

研究の動機と目的

  • 第一人称動画データのみを用いて、意識的な視覚的または触覚的相互作用を引き起こすオブジェクト(アクションオブジェクト)を検出する課題に対処すること。
  • 第三者視点カメラやウェアラブルセンサの制限を克服し、単一の第一人称視覚信号に依存すること。
  • タスク固有の適応なしに、人物とアクションオブジェクト間の特徴的な3次元空間的関係(距離および方向)をモデル化すること。
  • 多様で未観測の行動やオブジェクトカテゴリにわたるアクションオブジェクトを検出できる汎用性の高いモデルを開発すること。
  • ベンチマーク用に、ピクセル単位のアクションオブジェクトマスクを付与した新しいアノテート済み第一人称RGBDデータセットを提供すること。

提案手法

  • RGB(視覚的外観)と深度/高さ(3次元空間的レイアウト)の入力を並列に処理するジョイント二ストリームネットワークアーキテクチャを設計する。
  • 第一人称視点におけるアクションオブジェクトの空間的分布を符号化する第一人称座標埋め込み層を統合する。
  • 実世界のタスク中にカメラ装着者がアノテートしたピクセル単位のアクションオブジェクトマスクを用いて、エンド・ツー・エンドのネットワークを訓練する。
  • 両ストリームからの特徴を統合する共有統合パスウェイを用い、ピクセル単位のアクションオブジェクト出現確率を予測する。
  • 事前学習済みの単眼深度推定モデルを用いて、RGBのみのデータセット(例:GTEA Gaze+、Social Children Interaction)に深度予測を補完する。
  • ソフトマックス出力と交差エントロピー損失を用いて、ピクセル分類のためのモデル最適化を実施する。

実験結果

リサーチクエスチョン

  • RQ1ガazesトラッキングやウェアラブルセンサに依存せずに、第一人称動画のみでアクションオブジェクトを正確に検出できるか?
  • RQ2視覚的外観と3次元空間的特徴の統合は、第一人称動画におけるアクションオブジェクト検出にどの程度効果的か?
  • RQ3標準的な空間符号化と比較して、第一人称座標埋め込みは検出性能をどの程度向上させるか?
  • RQ4ある第一人称行動セットで学習したモデルは、新規で未観測の行動やオブジェクトカテゴリに一般化できるか?
  • RQ5多様な第一人称データセットにおいて、EgoNetは既存手法と比較して精度と頑健性の面で優れているか?

主な発見

  • 提案されたFirst-Person Action-Object RGBDデータセットにおいて、EgoNetは平均F1スコア0.396および平均精度0.313を達成し、ベースライン手法を上回った。
  • 第一人称座標埋め込みを削除すると、平均F1は0.313、平均精度は0.202に低下し、性能向上におけるその重要性が示された。
  • GTEA Gaze+データセット(RGBのみ、深度なし)において、EgoNetは平均F1 0.513、平均精度0.443を達成し、2番目に良い手法よりも平均F1で6.5%優れた性能を示した。
  • Social Children Interactionデータセットにおいて、EgoNetは平均F1 0.285、平均精度0.185を達成し、2番目に良い手法(平均F1 0.254、平均精度0.106)を著しく上回った。
  • 定性的な結果から、EgoNetは複数のデータセットにおいてDeepLab-FCNベースラインと比較して、より正確で局所化が良好なアクションオブジェクト予測を生成していることが示された。
  • 検出されたアクションオブジェクトの3次元可視化から、モデルが人間の相互作用パターンと整合する空間的配置を回復していることが確認され、将来的なロボット操作応用に有望であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。