Skip to main content
QUICK REVIEW

[論文レビュー] Social Behavior Prediction from First Person Videos

Shan Su, Jung Pyo Hong|arXiv (Cornell University)|Nov 29, 2016
Human Pose and Action Recognition参考文献 41被引用数 8
ひとこと要約

本論文は、3次元再構成を用いて社会的構成を自動アノテーションする第一人称動画ベースの手法を提案し、バスケットボール選手の将来の軌跡と視線方向を予測する。シアン型ネットワークを用いて自己中心視覚的意味を学習し、妥当な軌跡を検索。社会的適合性を最大化することで共同注意を考慮した視線整合性を実現し、5秒後の5mの位置誤差および30度の視線誤差で、第3者視点のベースラインを上回る性能を達成する。

ABSTRACT

This paper presents a method to predict the future movements (location and gaze direction) of basketball players as a whole from their first person videos. The predicted behaviors reflect an individual physical space that affords to take the next actions while conforming to social behaviors by engaging to joint attention. Our key innovation is to use the 3D reconstruction of multiple first person cameras to automatically annotate each other's the visual semantics of social configurations. We leverage two learning signals uniquely embedded in first person videos. Individually, a first person video records the visual semantics of a spatial and social layout around a person that allows associating with past similar situations. Collectively, first person videos follow joint attention that can link the individuals to a group. We learn the egocentric visual semantics of group movements using a Siamese neural network to retrieve future trajectories. We consolidate the retrieved trajectories from all players by maximizing a measure of social compatibility---the gaze alignment towards joint attention predicted by their social formation, where the dynamics of joint attention is learned by a long-term recurrent convolutional network. This allows us to characterize which social configuration is more plausible and predict future group trajectories.

研究の動機と目的

  • 第一人称動画からバスケットボール選手の長期的かつ社会的行動、具体的には将来の位置と視線方向を予測すること。
  • 第3者視点のコンピュータビジョンシステムが捉えにくい、状況に依存する微細な社会的ヒントをモデル化する課題に対処すること。
  • 第一人称動画に特有の視覚的信号を活用すること:個々の自己中心的文脈と集団の共同注意ダイナミクス。
  • 3次元再構成された第一人称データを用いて、視覚的社会的信号のスケーラブルかつ大規模な学習フレームワークを構築すること。
  • スポーツアナリティクス、ソーシャルロボティクス、バーチャルリアリティ/拡張現実の分野における応用を可能にすること。

提案手法

  • 複数の第一人称動画の3次元再構成を用い、他の選手の位置、方向、速度をサブピクセルの精度(再投影誤差 <0.5ピクセル)で自動的にアノテーションすることで、社会的構成の視覚的意味を付与する。
  • 自己中心視覚表現を学習するためのシアン型ニューラルネットワークを採用し、社会的および空間的構成を符号化。これにより、過去の類似状況の検索が可能となり、軌跡予測が実現される。
  • 社会的適合性スコア(予測された共同注意への視線整合性に基づく)を最大化するように、一般化されたダイクストラ法を用いて最も妥当なグループ軌跡集合を選択する。
  • 社会的形成特徴(選手の位置と速度)を用いて、共同注意のダイナミクスをモデリングするため、長期的再帰的畳み込みネットワーク(LRCN)を活用する。
  • シリンダープロジェクションを用いて第一人称動画入力を安定化させ、ジャイタリングとぼやけを低減し、生の自己中心視点からの視覚的特徴学習を強化する。
  • 3次元登録を用いて複数の選手の第一人称視点を統合し、個々の視点を超えた視界の拡張と文脈の豊かさの向上を実現する。

実験結果

リサーチクエスチョン

  • RQ1複雑な社会的相互作用において、第一人称動画データが長期的グループ行動(将来の軌跡と視線方向)を効果的に予測するために有効に使えるか?
  • RQ2社会的および空間的構成を認識するための自己中心視覚的意味をどのように学習できるか?
  • RQ3共同注意は、選手間の社会的適合性をモデル化する上で果たす役割は何か? そして、妥当なグループ軌跡を選択するために、どのように定量的に測定できるか?
  • RQ4第一人称カメラからの視覚的信号は、第3者視点の視点に比べて、社会的に整合性のある行動を予測する上でどの程度優れているか?
  • RQ5共同注意に基づく視線方向予測は、将来の行動およびシーンの想起の現実性と正確性を向上させることができるか?

主な発見

  • 提案手法は、5秒後の予測で5mの位置誤差および30度の視線方向誤差を達成し、第3者視点のベースラインを顕著に上回る性能を示した。
  • 社会的適合性と共同注意モデリングを統合しているため、Vanilla LSTM や Social LSTM よりも特に視線方向予測において優れた性能を発揮した。
  • 選手のポジションが予測精度に影響を与える:スクリーナーはセンターに比べ、より複雑かつ多様な相互作用を示すため、予測が困難である。
  • 運動学的データなしの視覚的特徴のみでは性能が著しく劣り、社会的および空間的文脈が強固な予測に不可欠であることが示された。
  • 社会的構成に基づく過去の類似シーケンスの検索により、定性的な比較で示されるように、解釈可能な予測推論が可能である。
  • K個の最良の軌跡解を用いた将来の画像の想起では、背景構造が整合的であり、時間経過に伴い徐々に劣化する妥当な社会的構成が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。