Skip to main content
QUICK REVIEW

[論文レビュー] EgoTransfer: Transferring Motion Across Egocentric and Exocentric Domains using Deep Neural Networks

Shervin Ardeshir, Krishna Regmi|arXiv (Cornell University)|Dec 17, 2016
Human Pose and Action Recognition参考文献 19被引用数 6
ひとこと要約

本稿では、エゴセントリック(第一人称)およびエクスタセントリック(第三人称)ビデオビュー間で運動特徴を転送するためのディーブラーニングフレームワーク、EgoTransferを提案する。線形および非線形モデルを用いて、視点間で運動情報が効果的に転送可能であることを示し、非線形マッピングがトップビュー転送において線形モデルを上回ること、また2ストリームネットワークがサイドビュー転送において特に優れた性能を示すことを明らかにした。特にC3D特徴量を用いる場合に顕著である。

ABSTRACT

Mirror neurons have been observed in the primary motor cortex of primate species, in particular in humans and monkeys. A mirror neuron fires when a person performs a certain action, and also when he observes the same action being performed by another person. A crucial step towards building fully autonomous intelligent systems with human-like learning abilities is the capability in modeling the mirror neuron. On one hand, the abundance of egocentric cameras in the past few years has offered the opportunity to study a lot of vision problems from the first-person perspective. A great deal of interesting research has been done during the past few years, trying to explore various computer vision tasks from the perspective of the self. On the other hand, videos recorded by traditional static cameras, capture humans performing different actions from an exocentric third-person perspective. In this work, we take the first step towards relating motion information across these two perspectives. We train models that predict motion in an egocentric view, by observing it from an exocentric view, and vice versa. This allows models to predict how an egocentric motion would look like from outside. To do so, we train linear and nonlinear models and evaluate their performance in terms of retrieving the egocentric (exocentric) motion features, while having access to an exocentric (egocentric) motion feature. Our experimental results demonstrate that motion information can be successfully transferred across the two views.

研究の動機と目的

  • エゴセントリックおよびエクスタセントリックな運動表現間のマッピングを学習することで、ミラーニューロンに類似した行動をモデル化すること。
  • 豊富なエクスタセントリックデータセットを活用することで、データの不足に起因する不均衡を是正し、エゴセントリック動画理解を向上させること。
  • 第三人称視点から観察した際の行動が第一人称視点でどのように見えるかを、知能システムが推論できるようにすること。
  • 線形および非線形モデルがエゴセントリックおよびエクスタセントリックドメイン間で運動特徴を転送する際の有効性を評価すること。
  • 特徴量タイプ(HOOF 対 C3D)および視点幾何(トップビュー 対 サイドビュー)が転送性能に与える影響を調査すること。

提案手法

  • ボディマウントカメラおよびスタティックカメラを用いて、同期されたエゴセントリックおよびエクスタセントリックビデオペアを収集する。
  • 両方の視点において16フレームのクリップからC3DおよびHOOFネットワークを用いて運動特徴を抽出する。
  • エゴセントリックおよびエクスタセントリック特徴空間間の変換を学習するための線形および非線形マッピングモデルを訓練する。
  • l2正則化線形回帰および非線形マルチレイヤーパーセプトロン(MLP)を用いて特徴変換を実行する。
  • 2ストリーム分類ネットワークを用いて、より良いクロスビュー検索のための共同表現を学習する。
  • リtrievalランク付けを用いてモデルを評価する:一方の視点からの特徴量が与えられたとき、他方の視点で正しいマッチングを検索する。

実験結果

リサーチクエスチョン

  • RQ1エクスタセントリック(第三人称)ビューからエゴセントリック(第一人称)ビューへ、逆にそれも含めて、運動特徴を効果的に転送できるか?
  • RQ2エゴセントリックおよびエクスタセントリックドメイン間で運動特徴を転送する際、非線形ディープニューラルネットワークは線形モデルを上回るか?
  • RQ3カメラの視点選択(トップビュー 対 サイドビュー)が運動特徴転送の性能に与える影響は何か?
  • RQ4運動特徴量の種別(C3D 対 HOOF)がクロスビュー転送の成功に与える影響は何か?
  • RQ52ストリームネットワークアーキテクチャは、標準の線形および非線形モデルと比較して、リtrieval精度を向上させられるか?

主な発見

  • 再構成目的を備えた非線形マッピングが、エゴからトップビューへの転送で最高のパフォーマンスを達成し、線形モデルを上回った。
  • エゴからサイドビューへの転送では、2ストリーム分類ネットワークが最良のリtrieval精度(83.76%)を達成し、他のすべての手法を顕著に上回った。
  • トップビュー転送において、非線形モデルはトップからエゴへのマッピングで83.92%のトップ-1正答率を達成したのに対し、線形モデルは73.11%にとどまった。
  • l2正則化を施した線形回帰は、すべての設定においてランダムおよび一様ベースラインを一貫して上回った。
  • C3D特徴量は線形モデルにおいて優れたパフォーマンスを発揮し、線形変換にすでに最適化されている可能性を示唆した。
  • 2ストリームネットワークは、サイドビュー転送において線形および非線形モデルを顕著に上回った。これは、視覚的に類似した複雑な視点に適していることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。