Skip to main content
QUICK REVIEW

[論文レビュー] Predicting Human Interaction via Relative Attention Model

Yichao Yan, Bingbing Ni|arXiv (Cornell University)|May 26, 2017
Human Pose and Action Recognition参考文献 15被引用数 5
ひとこと要約

本稿では、共有の再帰構造と注目メカニズムを用いて、2つの相互作用する主体間の相互影響をモデル化する三重結合相対注目ネットワークを提案する。グローバルな相互作用コンテキストを統合し、注目メカニズムによって重要なボディパーツに焦点を当てることで、モデルは最先端の精度を達成し、遮蔽や複雑な背景下でも、ビデオ観測率が50%にとどまっている状況でBITデータセットにおいて90%を超える精度を達成する。

ABSTRACT

Predicting human interaction is challenging as the on-going activity has to be inferred based on a partially observed video. Essentially, a good algorithm should effectively model the mutual influence between the two interacting subjects. Also, only a small region in the scene is discriminative for identifying the on-going interaction. In this work, we propose a relative attention model to explicitly address these difficulties. Built on a tri-coupled deep recurrent structure representing both interacting subjects and global interaction status, the proposed network collects spatio-temporal information from each subject, rectified with global interaction information, yielding effective interaction representation. Moreover, the proposed network also unifies an attention module to assign higher importance to the regions which are relevant to the on-going action. Extensive experiments have been conducted on two public datasets, and the results demonstrate that the proposed relative attention network successfully predicts informative regions between interacting subjects, which in turn yields superior human interaction prediction accuracy.

研究の動機と目的

  • 部分的に観測された動画から人間の相互作用を予測する課題に、相互作用する主体間の影響をモデル化することで対処すること。
  • 相互作用予測に寄与する、特に動的なボディパーツを含む、最も判別的な時空間的領域を特定し、焦点を当てる。
  • 包括的・個別的・部分ベースの特徴抽出手法の限界を克服するため、局所的注目とグローバルな相互作用モデリングを統合すること。
  • 学習された注目メカニズムによって動き関連領域に焦点を当てることで、遮蔽や背景の雑多さに対する耐性を高めること。

提案手法

  • 3つのスレッド(各主体1つずつと、両者を囲むグローバル相互作用領域用)を持つ三重結合深層再帰ネットワークを使用する。
  • 各時刻で、3つのスレッドの隠れ状態が集約され、相互影響のモデル化が可能になるように、相互作用状態を更新する。
  • 相対的注目モジュールを統合し、両主体の現在の行動と過去の隠れ状態に基づいて、情報をもたらす領域を動的に選択する。
  • 注目モジュールは、入力特徴から関連するボディパーツ(例:腕、脚)にのみ焦点を当てる空間的重みを出力し、表現品質を向上させる。
  • 動きの感度を高めるために、光流体入力を採用し、注目メカニズムを流体特徴に適用して、重要な動きパターンを検出する。
  • 最終的な予測は、三重結合ネットワークからの注目および統合された表現を用いた分類ヘッドによって行われる。

実験結果

リサーチクエスチョン

  • RQ1動画ベースの行動予測フレームワークにおいて、2つの相互作用する主体間の相互影響を効果的にモデル化する方法は何か?
  • RQ2全体フレーム特徴ではなく、判別的な局所的動き領域(例:四肢)に焦点を当てる場合、相互作用予測に与える影響は何か?
  • RQ3グローバルまたは個別的特徴学習と比較して、相対的注目メカニズムは、部分観測や遮蔽下でも性能を向上させられるか?
  • RQ4グローバル相互作用コンテキストの統合は、複数主体設定における局所的行動表現をどのように向上させるか?

主な発見

  • 提案手法は、ビデオ観測率が50%にとどまっている状況でも、BITデータセットで90%を超える予測精度を達成し、観測率の全範囲で先行する最先端手法を10%以上上回る。
  • 相対的注目を備えた三重結合ネットワークは、ベースラインモデルに比べて顕著な性能向上を示し、特に高い観測率下でその有効性が顕著に現れる。
  • RGBフレームと比較して、光流体入力が著しく優れた性能を示し、相互作用予測において動きの手がかりの重要性を強調する。
  • 定性的な結果から、注目モジュールが一貫して行動関連のボディパーツ(例:伸ばされた腕や脚)に焦点を当てる様子が確認され、人間の認識と整合していることが示された。
  • 遮蔽が強く、背景が複雑な状況下でも、強力な性能を発揮し、困難なBITデータセットでの高い耐性が裏付けられた。
  • アブレーションスタディにより、相対的注目モジュールが三重結合アーキテクチャそのものよりも顕著な性能向上をもたらすことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。