Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting spatio-temporal layouts for compositional action recognition

Gorjan Radevski, Marie‐Francine Moens|arXiv (Cornell University)|Nov 2, 2021
Human Pose and Action Recognition被引用数 8
ひとこと要約

本稿では、物体のバウンディングボックスの配置(レイアウト)に基づく時空間的構成—視覚的外観に依存しないアクション認識を可能にする、マルチヘッドアテンション機構を提案する。実験により、レイアウトベースのモデルが構成的および少サンプル設定において良好に一般化すること、また、外観モデル(例:I3D)と統合することで、Action Genomeのようなごみ混じりで構成的でないデータセットでさえも性能が著しく向上することを示している。

ABSTRACT

Recognizing human actions is fundamentally a spatio-temporal reasoning problem, and should be, at least to some extent, invariant to the appearance of the human and the objects involved. Motivated by this hypothesis, in this work, we take an object-centric approach to action recognition. Multiple works have studied this setting before, yet it remains unclear (i) how well a carefully crafted, spatio-temporal layout-based method can recognize human actions, and (ii) how, and when, to fuse the information from layout and appearance-based models. The main focus of this paper is compositional/few-shot action recognition, where we advocate the usage of multi-head attention (proven to be effective for spatial reasoning) over spatio-temporal layouts, i.e., configurations of object bounding boxes. We evaluate different schemes to inject video appearance information to the system, and benchmark our approach on background cluttered action recognition. On the Something-Else and Action Genome datasets, we demonstrate (i) how to extend multi-head attention for spatio-temporal layout-based action recognition, (ii) how to improve the performance of appearance-based models by fusion with layout-based models, (iii) that even on non-compositional background-cluttered video datasets, a fusion between layout- and appearance-based models improves the performance.

研究の動機と目的

  • 注意深く設計されたレイアウトベースの手法が、構成的および少サンプルアクション認識において強力な性能を達成できるかを調査すること。
  • レイアウトベースと外観ベースのモデルの最適な統合戦略を特定し、アクション認識性能を向上させること。
  • 背景がごみ混じりで構成的でない動画データセットにおいて、レイアウトベースの推論がどれほど頑健であるかを評価すること。
  • 外観の手がかりなしに、物体のレイアウトからグローバルな空間的・時系列的文脈を捉えるためにマルチヘッドアテンションがどれほど有効であるかを評価すること。

提案手法

  • 視覚的外観に依存せず、動画フレームにわたる物体のバウンディングボックスの系列(時空間的レイアウト)に対してマルチヘッドアテンションを適用する。
  • トランスフォーマーに基づくアーキテクチャを用い、レイアウト内の物体同士の長距離依存関係やグローバルな空間的関係をモデル化する。
  • レイアウト特徴と外観特徴を後段結合により統合し、両ブランチの個々の強みを保持する。
  • レイアウトモジュールの入力として、オブジェクト検出器(例:Faster R-CNN)を用いてオブジェクト検出を抽出する。
  • 構成的および非構成的設定の両方で、Something-ElseおよびAction Genomeの2つのベンチマークで訓練および評価を実施する。
  • 外観バックボーンとしてI3Dを用い、STLTモデルとアンサンブルすることでmAPを向上させる。

実験結果

リサーチクエスチョン

  • RQ1外観情報なしに、マルチヘッドアテンションモデルが時空間的レイアウトのみで構成的アクション認識にどの程度の性能を発揮できるか。
  • RQ2レイアウトベースと外観ベースのモデルを統合する最適な方法は何か、アクション認識性能の向上に寄与するか。
  • RQ3レイアウトベースのモデルは、新しいオブジェクトカテゴリに一般化できるか、少サンプルまたは構成的設定でも良好に動作するか。
  • RQ4Action Genomeのような非構成的で背景がごみ混じりのデータセットにおいて、レイアウトに基づく推論が性能向上に寄与するか。

主な発見

  • Action Genomeデータセットにおいて、2つのオブジェクトカテゴリ(person, object)のみを対象とした場合、STLTモデルはオラクル設定で19.9 mAPを達成し、I3Dを3.0 mAP上回った。
  • 38のオブジェクトカテゴリをすべて使用した場合、STLTはオラクル設定で60.6 mAPを達成し、アノテーション済みシーングラフを用いるSGFBに近い性能に到達した。
  • STLTとI3Dをアンサンブルした場合、オラクル設定でAction GenomeにおいてI3D単体に比べ28.1 mAPの向上を達成し、LFBおよびSGFBを上回った。
  • オブジェクト検出設定(非オラクル)においても、38のカテゴリすべてを用いた場合、STLTはI3Dを5.0 mAP向上させ、検出エラーに対して頑健であることを示した。
  • レイアウトベースのモデルは、新しいオブジェクトカテゴリへの一般化が効果的に可能であり、強力な少サンプルおよび構成的一般化能力を示した。
  • レイアウトと外観のモデル統合は、両ブランチが個々の能力を保持した状態で実施する際に最も効果的であり、補完的モデリングの重要性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。