Skip to main content
QUICK REVIEW

[論文レビュー] Real-Time End-to-End Action Detection with Two-Stream Networks

Alaaeldin El-Nouby, Graham W. Taylor|arXiv (Cornell University)|Feb 23, 2018
Human Pose and Action Recognition参考文献 20被引用数 9
ひとこと要約

本論文は、光流の計算にFlownet2を統合し、ストリーム間で特徴を早期に統合することで、リアルタイムでエンド・ツー・エンドに学習可能な2ストリームYOLOv2ネットワークを、動画行動検出のための提案する。両ストリームを共同で訓練し、Kineticsで光流ネットワークを微調整することで、31 fpsで最先端の性能を達成し、エンド・ツー・エンド最適化と転移学習による効率性と正確性の向上を実現した。

ABSTRACT

Two-stream networks have been very successful for solving the problem of action detection. However, prior work using two-stream networks train both streams separately, which prevents the network from exploiting regularities between the two streams. Moreover, unlike the visual stream, the dominant forms of optical flow computation typically do not maximally exploit GPU parallelism. We present a real-time end-to-end trainable two-stream network for action detection. First, we integrate the optical flow computation in our framework by using Flownet2. Second, we apply early fusion for the two streams and train the whole pipeline jointly end-to-end. Finally, for better network initialization, we transfer from the task of action recognition to action detection by pre-training our framework using the recently released large-scale Kinetics dataset. Our experimental results show that training the pipeline jointly end-to-end with fine-tuning the optical flow for the objective of action detection improves detection performance significantly. Additionally, we observe an improvement when initializing with parameters pre-trained using Kinetics. Last, we show that by integrating the optical flow computation, our framework is more efficient, running at real-time speeds (up to 31 fps).

研究の動機と目的

  • ストリームを別々に訓練し、外部の光流アルゴリズムを用いる従来の2ストリーム行動検出手法の非効率性と最適でない性能を改善すること。
  • GPUの効率的利用と遅延の低減を図るために、光流計算をニューラルネットワークパイプラインに直接統合し、リアルタイム推論を可能にすること。
  • 両方のストリームを共同で訓練し、特徴を早期に統合することで、特徴の相互適応を可能にし、検出の正確性を向上させること。
  • 大規模なKinetics行動認識の事前学習を活用することで、小規模な行動検出データセットにおける過学習を軽減すること。
  • 行動検出の目的に合わせて、ニューラル光流推定器(Flownet2)を微調整することで、従来のEPE最適化済みの光流よりも優れた動き表現が得られることを示すこと。

提案手法

  • Flownet2を微分可能な光流モジュールとして2ストリームネットワーク内に統合し、外見と動きの両ストリームのエンド・ツー・エンド訓練を可能にする。
  • 最終活性化関数の出力をRGBストリームと光流ストリームで連結することで、最終予測ヘッドの前に特徴を早期に統合する。
  • 共有バックボーンと共同最適化を備えたYOLOv2ベースのアーキテクチャを、2ストリーム動画行動検出に適応させた。
  • 行動検出の微調整前に、行動認識のための全体フレームワークをKineticsデータセットで事前学習した。
  • 元のEPE最適化済み重みに依存せず、行動検出の目的に特化してFlownet2コンponentを微調整した。
  • 訓練の安定化と深層2ストリームアーキテクチャにおける勾配の流れの改善のため、バッチ正規化とスキップ接続を採用した。

実験結果

リサーチクエスチョン

  • RQ12ストリームネットワークに光流計算を直接統合することで、リアルタイム性能とエンド・ツー・エンド訓練の効率性が向上するか?
  • RQ2外見と動きのストリームを共同で訓練し、早期統合を行うことで、別々の訓練よりも高い行動検出正確性が得られるか?
  • RQ3大規模な行動認識(Kinetics)からの転移学習が、小規模な行動検出データセットでの性能向上に寄与するか?
  • RQ4行動検出の目的に合わせて、ニューラル光流ネットワーク(Flownet2)を微調整することで、固定された事前計算済みの光流よりも優れた動き表現が得られるか?
  • RQ5提案されたフレームワークは、UCF-101-24で最先端の正確性を維持しながら、リアルタイム推論(≥30 fps)を達成できるか?

主な発見

  • 提案されたエンド・ツー・エンドフレームワークはバッチサイズ4で31 fpsを達成し、流計算のオーバーヘッドを考慮してもSinghら[18]を3 fps上回った。
  • Flownet2を行動検出の目的に合わせて微調整することで、事前学習済みFlownet2をそのまま使用した場合に比べ、mAPが0.89ポイント向上した。
  • Kineticsの事前学習を適用することで、IoU閾値0.5のUCF-101-24でf-mAPが6.91ポイント上昇(67.18から74.07に)した。
  • 微調整済みFlownet2とKinetics事前学習を組み合わせたモデルは、IoU=0.5で74.07のf-mAPを達成し、トリムドUCF-101-24動画における他の報告済み手法をすべて上回った。
  • 両ストリームの特徴を早期に統合することで、後期統合や別々の訓練よりも優れた性能が得られ、相補的な学習が示された。
  • ネットワーク内に流計算を統合することで、メモリ転送のオーバーヘッドが低減され、GPU並列処理の効率性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。