Skip to main content
QUICK REVIEW

[論文レビュー] Joint Network based Attention for Action Recognition

Yemin Shi, Yonghong Tian|arXiv (Cornell University)|Nov 16, 2016
Human Pose and Action Recognition参考文献 4被引用数 4
ひとこと要約

本稿では、トレーニング中に制限付きのソフトマックスゲート接続を通じてクロスストリーム情報共有を可能にする、ジョイントネットワークベースのアテンション(JNA)モデルを提案する。このモデルは、アクション認識のための2ストリームConvNetを向上させるとともに、時間的アテンションメカニズムを導入して顕著なフレームを特定する。この手法は、ベースラインの2ストリームモデルと比較して、HMDB51で8.5%、UCF101で1%の精度向上を達成し、最先端の性能を実現した。

ABSTRACT

By extracting spatial and temporal characteristics in one network, the two-stream ConvNets can achieve the state-of-the-art performance in action recognition. However, such a framework typically suffers from the separately processing of spatial and temporal information between the two standalone streams and is hard to capture long-term temporal dependence of an action. More importantly, it is incapable of finding the salient portions of an action, say, the frames that are the most discriminative to identify the action. To address these problems, a extbf{j}oint extbf{n}etwork based extbf{a}ttention (JNA) is proposed in this study. We find that the fully-connected fusion, branch selection and spatial attention mechanism are totally infeasible for action recognition. Thus in our joint network, the spatial and temporal branches share some information during the training stage. We also introduce an attention mechanism on the temporal domain to capture the long-term dependence meanwhile finding the salient portions. Extensive experiments are conducted on two benchmark datasets, UCF101 and HMDB51. Experimental results show that our method can improve the action recognition performance significantly and achieves the state-of-the-art results on both datasets.

研究の動機と目的

  • 動画における長期的な時間的依存関係を捉えることや、判別的なフレームを特定することに課題を抱える2ストリームConvNetの限界を解消すること。
  • 共同学習中に空間ストリームが時間ストリームを圧倒する「ワンストリーム・ドミネート・ネットワーク」問題を克服すること。
  • 過学習や性能の低下を引き起こさずに、空間的および時間的ブランチ間での効果的な情報交換を可能にするメカニズムを開発すること。
  • アクション認識に最も有用なフレームを強調する時間的アテンションメカニズムを導入すること。
  • ジョイントトレーニングとアテンションベースのフレーム選択を統合することで、ベンチマークデータセットで最先端の性能を達成すること。

提案手法

  • JNAモデルは、空間的および時間的ストリームがトレーニング中にソフトマックスゲート接続を通じて情報を共有するジョイントネットワーク構造を採用しており、情報の流れを重要な特徴に限定する。
  • 長期的な時間的依存関係をモデル化し、フレーム列における顕著なフレームに高い重みを割り当てるために、GRUを用いた時間的アテンションメカニズムが適用される。
  • アテンション重みはソフトマックス層の前で計算され、ネットワークがアクション分類に最も寄与するフレームを学習できるようにする。
  • アブレーションスタディの結果、完全結合型融合、ブランチ選択、空間的アテンションは実用的でないことが判明した。
  • クロスエントロピー損失を用いてエンドツーエンドでネットワークをトレーニングし、最終的な予測は両ストリームのアテンション重み付き特徴量の融合によって行われる。
  • 時間的ストリームにオプティカルフロー入力を使用することで、動きの変動に強い耐性を向上させるために、JNAのワーパー版も導入されている。

実験結果

リサーチクエスチョン

  • RQ1空間的および時間的ストリーム間でゲート付き情報フローを有するジョイントネットワーク構造が、標準的な2ストリームモデルを上回るアクション認識性能を実現できるか?
  • RQ2時間的アテンションメカニズムを導入することで、長期的な時間的モデリングが向上し、動画内の最も判別に寄与するフレームを特定できるか?
  • RQ3完全結合型融合、ブランチ選択、空間的アテンション機構がアクション認識の文脈で失敗する理由は何か? その欠陥をどのように是正できるか?
  • RQ4提案されたJNAモデルは、HMDB51やUCF101といった困難なベンチマークで、既存の最先端手法と比較してどの程度性能が向上するか?
  • RQ5JNAのアテンションメカニズムは、関係のないフレームを除外し、アクションに重要なセグメントに焦点を当てるネットワークの能力をどのように反映しているか?

主な発見

  • JNAはHMDB51でトップ1精度66.9%、UCF101で91.2%を達成し、ベースラインの2ストリームモデルと比較してそれぞれ8.5%、1%の精度向上を達成した。
  • 長時間の動画シーケンスでは顕著なフレームを特定することで大きな性能向上が見られた一方、短時間のUCF101動画ではその恩恵が限定的であった。
  • マルチブランチアテンション(HMDB51で61.7%)やソフトアテンション(41.3%)といった他のアテンションベース手法を上回り、本手法の有効性を示した。
  • アテンション重みの可視化結果から、JNAは後続のフレームに高い重みを割り当てており、GRUの記憶容量と整合しており、長期的な依存関係を学習できていることが確認された。
  • 可視化における円で囲まれた負のアテンション重みは、JNAがアクションの発症を検出でき、初期の無関係なフレームを除外できることを示している。
  • ワーパー版JNAはHMDB51で66.3%、UCF101で90.0%を達成し、標準JNAと組み合わせることでHMDB51で68.8%、UCF101で91.5%を達成し、データ拡張によるさらなる性能向上が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。