Skip to main content
QUICK REVIEW

[論文レビュー] Modeling Spatio-Temporal Human Track Structure for Action Localization

Guilhem Chéron, Anton Osokin|arXiv (Cornell University)|Jun 28, 2018
Human Pose and Action Recognition参考文献 59被引用数 4
ひとこと要約

本稿では、人物のトラックにおける時間的行動構造をモデル化するため、ゲート付き再帰ユニット(GRUs)を用いた再帰的局所化ネットワーク(RecLNet)を提案する。これにより、スパatiotemporal行動局所化が向上する。外見特徴と光流特徴を二重ストリームGRUで処理し、しきい値ベースの時間的フィルタリングを適用することで、RecLNetはUCF101-24およびDALYで最先端の性能を達成し、ベースラインのCNNよりも顕著に時間的境界検出性能が向上する。

ABSTRACT

This paper addresses spatio-temporal localization of human actions in video. In order to localize actions in time, we propose a recurrent localization network (RecLNet) designed to model the temporal structure of actions on the level of person tracks. Our model is trained to simultaneously recognize and localize action classes in time and is based on two layer gated recurrent units (GRU) applied separately to two streams, i.e. appearance and optical flow streams. When used together with state-of-the-art person detection and tracking, our model is shown to improve substantially spatio-temporal action localization in videos. The gain is shown to be mainly due to improved temporal localization. We evaluate our method on two recent datasets for spatio-temporal action localization, UCF101-24 and DALY, demonstrating a significant improvement of the state of the art.

研究の動機と目的

  • 個々の人物トラックレベルでの行動の時間的構造をモデル化することで、スパatiotemporal行動局所化を向上させること。
  • 既存手法が時間的境界検出において弱く、誤検出や不正確な局所化を引き起こすという問題を是正すること。
  • 外見特徴と運動特徴を統合して、時間的に行動を同時に認識・局所化する再帰的ニューラルネットワークを構築すること。
  • 再帰的処理により、特にベースライン手法が失敗する状況においても、時間的局所化の正確性が顕著に向上することを示すこと。
  • 最近の空間的検出精度の進展と相補的であることを示し、空間的局所化のさらなる向上の余地があること。

提案手法

  • RecLNetは、動画シーケンス内の人物バウンディングボックスから抽出された外見特徴と光流特徴を処理するため、二重ストリームのゲート付き再帰ユニット(GRUs)を採用する。
  • 特徴はFast-RCNNを用いて領域提案からプーリングされ、それぞれ別個のGRU層に供給され、各人物トラック内での長期的な時間的依存性をモデル化する。
  • GRU出力に対してしきい値処理とフィルタリング戦略を適用し、正確な時間的境界を持つ最終的な行動検出を生成する。
  • モデルはエンドツーエンドで訓練され、各トラックごとに行動クラスを同時に認識し、時間的区間を局所化する。
  • 時間的局所化は、高得点応答をフィルタリングし、しきい値を適用して誤検出を抑制することで最適化される。
  • 標準ベンチマークUCF101-24およびDALYを用いて評価され、CNNベースのベースラインおよび最先端手法と比較される。

実験結果

リサーチクエスチョン

  • RQ1再帰ネットワークを用いて人物トラック上で時間的構造をモデル化することで、時間的行動局所化の正確性が向上するか?
  • RQ2外見特徴および光流ストリームにGRUを適用することで、標準のCNNと比較して行動境界の検出が向上するか?
  • RQ3提案手法RecLNetは、スパatiotemporal局所化性能において、最先端の手法と比較してどのように差をつけるか?
  • RQ4向上の主な要因が空間的検出の向上ではなく、時間的局所化の向上によるものである程度はどの程度か?
  • RQ5最近の空間的検出技術と組み合わせることで、全体の性能をさらに向上させることができるか?

主な発見

  • RecLNetはUCF101-24データセットで最先端の性能を達成し、スパatiotemporal行動局所化において、以前の手法を顕著に上回る。
  • DALYデータセットでは、CNN RGB+OFベースラインと比較して、特に時間的境界局所化において顕著な向上を示す。
  • 定性的な分析から、RecLNetのスコアは、しばしば不正確またはノイズが多い応答を示すベースライン手法と比較して、正解の行動境界とよりよく一致していることが明らかになった。
  • 誤検出が減少しており、定性的な結果における高得点の破線の数が少ないことから、より信頼性の高い検出が得られていることが裏付けられている。
  • 既存手法における時間的局所化の弱みが特定され、RecLNetは再帰的モデリングによりこれを効果的に是正している。
  • 本手法は最近の空間的精度の向上と相補的であることが示され、将来的にはより良い空間的検出とRecLNetの強力な時間的モデリングを組み合わせることで、さらなる向上が期待できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。