Skip to main content
QUICK REVIEW

[論文レビュー] Structure Inference Machines: Recurrent Neural Networks for Analyzing Relations in Group Activity Recognition

Zhiwei Deng, Arash Vahdat|arXiv (Cornell University)|Nov 13, 2015
Human Pose and Action Recognition被引用数 13
ひとこと要約

本稿では、グループアクティビティ認識のための深層学習と構造的推論を統合する再帰的ニューラルネットワークフレームワーク、構造推論マシン(SIMs)を提案する。学習可能なゲートを用いてシーン内の個々の人物間の関係を動的に決定することで、SIMsは反復的にアクション予測を精緻化し、シーンレベルの分類を向上させ、Collective Activity Datasetでは最先端の81.2%の正確性を達成し、人物レベルのアクション認識では最大10%の向上を実現した。

ABSTRACT

Rich semantic relations are important in a variety of visual recognition problems. As a concrete example, group activity recognition involves the interactions and relative spatial relations of a set of people in a scene. State of the art recognition methods center on deep learning approaches for training highly effective, complex classifiers for interpreting images. However, bridging the relatively low-level concepts output by these methods to interpret higher-level compositional scenes remains a challenge. Graphical models are a standard tool for this task. In this paper, we propose a method to integrate graphical models and deep neural networks into a joint framework. Instead of using a traditional inference method, we use a sequential inference modeled by a recurrent neural network. Beyond this, the appropriate structure for inference can be learned by imposing gates on edges between nodes. Empirical results on group activity recognition demonstrate the potential of this model to handle highly structured learning tasks.

研究の動機と目的

  • 平坦な分類を超えて、複雑で構成的な視覚的関係をモデル化する課題に取り組む。
  • エンティティ間の構造的推論を可能にすることで、低レベルの深層ネットワーク出力と高レベルのシーン理解を橋渡しする。
  • 固定グラフィカルモデルや従来の推論手法の限界を克服し、メッセージ伝達中に適応的で動的な構造を学習する。
  • ノード分類、メッセージ伝達、構造的接続性をゲーティングを通じて共同最適化するエンドツーエンドで訓練可能なフレームワークを開発する。
  • 複雑で変動するグループ間相互作用を示す現実世界のデータセットにおいて、本手法の有効性を実証する。

提案手法

  • 畳み込みニューラルネットワーク(CNN)の出力に対して再帰的ニューラルネットワーク(RNN)を用いて反復的に推論を実行し、メッセージ伝達によってノード予測を精緻化する。
  • ノード間のエッジに学習可能なゲート関数を導入し、どの接続が関連するかを決定することで、推論中に動的構造学習を可能にする。
  • 重みが固定または非固定のゲーティングメッセージ伝達を適用し、ゲート値を微分可能関数で計算することで情報の流れを制御する。
  • バックプロパゲーションを用いてモデル全体をエンドツーエンドで訓練し、CNN特徴量、メッセージ伝達、構造的ゲートを同時に最適化可能にする。
  • 各イテレーションが、接続されたノードからの文脈に基づいてノード予測を精緻化する段階的な推論プロセスとして定式化する。
  • 推論の微分可能近似を用いることで、メッセージ重みと構造的接続性の両方を勾配ベースの学習が可能になる。

実験結果

リサーチクエスチョン

  • RQ1再帰的ニューラルネットワークは、視覚的推論タスクのための深層ニューラルネットワーク出力に対して構造的推論を効果的に行うために適しているか?
  • RQ2学習可能なゲートは、グループアクティビティ認識における人物間の動的でタスク固有の関係をどの程度改善できるか?
  • RQ3エンドツーエンドで訓練される統合型ディープラーニングとグラフィカルモデルフレームワークは、従来のCRFやSVMベースの手法と比較して、正確性と一般化性能の面でどのように差をつけるか?
  • RQ4グラフィカルモデルの構造(つまり、どのノードが接続されているか)を学習できることにより、固定構造や完全接続構造よりも顕著な性能向上が得られるか?
  • RQ5本手法は、グループ相互作用の複雑さやノイズの程度が異なる多様なデータセットにおいて、どの程度の頑健性を示すか?

主な発見

  • 提案モデルはCollective Activity Datasetで81.2%の正確性を達成し、Deep Struct. Model(80.6%)やUnified Tracking And Recognition(80.6%)といった最先端手法を上回った。
  • Collective Activity Extended Datasetでは、ゲーティングメッセージ伝達を2回実行した後、人物レベルのアクション分類で約10%の向上が見られ、90.14%の正確性に到達した。
  • オリジナルのCollective Activity Datasetでは、ゲーティング接続を用いた3回のメッセージ伝達イテレーション後に、人物レベルのアクション分類で6%の向上が確認された。
  • ゲーティング重みの使用により顕著な性能向上が得られた:ゲートなしの非固定重みでは74.33%、ゲートありの非固定重みでは81.22%の正確性を達成した。
  • Nursing Home Datasetでは、2回のイテレーション後に人物レベルのアクション正確性が4%向上し、単純で予測可能な関係が支配する状況でも一貫した向上が確認された。
  • 可視化結果から、モデルは意味のある非一様な接続を学習しており、ノイズが多いまたは関係のない関係をフィルタリングしながら、同じアクションをとる人物間の重要な相互作用を保持していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。