Skip to main content
QUICK REVIEW

[論文レビュー] Recurrent Space-time Graph Neural Networks

Andrei Liviu Nicolicioiu, Iulia Duta|arXiv (Cornell University)|Apr 11, 2019
Human Pose and Action Recognition参考文献 62被引用数 19
ひとこと要約

本論文では、反復的メッセージパッシングと再帰的記憶状態を通じて、空間と時間を別々にかつ共同で処理する、画期的なグラフベースのモデルである再帰的空間時間グラフ(RSTG)ニューラルネットワークを提案する。このモデルは、2次元畳み込みネットワーク(2D ConvNet)バックボーンを用いた場合、強力なベースラインを8%以上上回るトップ1正解率を達成し、3D-ResNet-50バックボーンを用いた場合にも3.1%の向上を示した。

ABSTRACT

Learning in the space-time domain remains a very challenging problem in machine learning and computer vision. Current computational models for understanding spatio-temporal visual data are heavily rooted in the classical single-image based paradigm. It is not yet well understood how to integrate information in space and time into a single, general model. We propose a neural graph model, recurrent in space and time, suitable for capturing both the local appearance and the complex higher-level interactions of different entities and objects within the changing world scene. Nodes and edges in our graph have dedicated neural networks for processing information. Nodes operate over features extracted from local parts in space and time and previous memory states. Edges process messages between connected nodes at different locations and spatial scales or between past and present time. Messages are passed iteratively in order to transmit information globally and establish long range interactions. Our model is general and could learn to recognize a variety of high level spatio-temporal concepts and be applied to different learning tasks. We demonstrate, through extensive experiments and ablation studies, that our model outperforms strong baselines and top published methods on recognizing complex activities in video. Moreover, we obtain state-of-the-art performance on the challenging Something-Something human-object interaction dataset.

研究の動機と目的

  • 動画データにおける複雑な空間時間的相互作用を学習する課題に取り組むこと。現在のモデルは、固定アーキテクチャや長距離モデリングの欠如によってしばしば制限を受ける。
  • 局所的な外観とグローバルで高次の空間時間的関係を効果的に捉えることのできる汎用的でエンドツーエンドで訓練可能なニューラルネットワークを構築すること。
  • 統一されたグラフフレームワーク内での空間と時間の処理の因子分解を実現し、動的ビジョナルシーンの効率的で柔軟なモデリングを可能にすること。
  • 特にSomething-Something-v1のような現実世界の複雑な人間-オブジェクトインタラクションデータセットにおいて、モデルの有効性を実証すること。
  • 再帰的記憶の役割や分離された空間時間処理の重要性を裏付けるためのアブレーションスタディを提供すること。

提案手法

  • モデルは、例えばI3Dのようなバックボーンネットワークを用いて空間時間的特徴を抽出し、それを空間的領域を表すノードと時間的・空間的隣接ノード間のメッセージをエンコードするエッジを持つ再帰的空間時間グラフに供給する。
  • 各ノードは、局所的特徴、隣接空間ノードからのメッセージ、および自身の再帰的記憶状態を、専用のニューラルネットワークを用いて処理し、動的な状態更新を可能にする。
  • 各イテレーション内で空間処理ステージと時間処理ステージを交互に実行することで、空間的・時間的両方にわたる長距離依存関係を確立する反復的メッセージパッシングが可能になる。
  • 2つのバリアントを導入する:RSTG-to-vecはグローバルな動画レベルの埋め込みを出力し、RSTG-to-mapは各時刻ごとに3次元の特徴マップを出力し、空間分解能を保持する。
  • 残差接続を用いて訓練の安定化を図り、グラフ出力をバックボーン特徴に加えることで勾配の流れを確保し、最適化を改善する。
  • 動画分類タスクにおいて標準的なクロスエントロピー損失を用い、ランダムクロッピングとフレームサンプリングによるデータオーグメンテーションを加えて、エンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1統一されたGNNアーキテクチャが、別々の再帰的処理ステージを用いて、動画データの空間的および時間的依存関係を効果的にモデル化できるか?
  • RQ2空間と時間の処理を因子分解することで、統合的または逐次的モデリングと比較して性能にどのような影響を与えるか?
  • RQ33D畳み込みニューラルネットワークのバックボーン内でグラフを異なる深さに配置した場合、下流の認識精度にどのような影響を与えるか?
  • RQ4提案されたモデルが、Something-Something-v1のような複雑な現実世界の人間-オブジェクトインタラクションデータセットで最先端の性能を達成できるか?
  • RQ5Non-Localネットワークなどの既存手法と比較して、RSTGモデルの計算複雑度は、同等の精度条件下でどのように異なるか?

主な発見

  • I3Dバックボーンのres3およびres4ブロックの直後に配置されたRSTG-to-mapモデルが、Something-Something-v1データセットで最高の性能を示し、トップ1正解率49.2%を達成した。
  • 2D ConvNetバックボーンを用いた場合、RSTGモデルは、同じバックボーンアーキテクチャを用いた他のすべての手法よりもトップ1正解率を8%以上向上させた。
  • 3D-ResNet-50バックボーンを用いた場合、RSTGモデルは、最高の公表済み手法よりもトップ1正解率で3.1%の向上を達成した。
  • RSTG-to-vecバリアントは、Non-Localネットワークよりも高い正解率を維持しながら、より高速な推論を実現し、効率性と精度のトレードオフに優れた性能を示した。
  • アブレーションスタディにより、分離された空間時間処理と再帰的記憶状態の両方が性能に不可欠であることが確認され、いずれかのコンponentを除去すると顕著な正解率の低下が見られた。
  • モデルは優れた一般化性能を示し、複数のバックボーン配置においても競争力ある結果を達成した。特に中間層(res3およびres4)にグラフを挿入した場合に最高の性能が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。