Skip to main content
QUICK REVIEW

[論文レビュー] Context-Aware RCNN: A Baseline for Action Detection in Videos

Jian-Chao Wu, Zhanghui Kuang|arXiv (Cornell University)|Jul 20, 2020
Human Pose and Action Recognition参考文献 33被引用数 4
ひとこと要約

本論文では、I3Dによる特徴抽出の前にアクター領域を高解像度にクロップおよびリサイズすることで、シーンおよび長期的文脈を統合することにより、性能を向上させるシンプルだが効果的な動画行動検出のベースラインであるContext-Aware RCNNを提案する。標準のResNet-50バックボーンを用いても、AVAで28.0%、JHMDBで79.2%のSOTA mAPを達成し、先行手法を上回る性能を発揮する。

ABSTRACT

Video action detection approaches usually conduct actor-centric action recognition over RoI-pooled features following the standard pipeline of Faster-RCNN. In this work, we first empirically find the recognition accuracy is highly correlated with the bounding box size of an actor, and thus higher resolution of actors contributes to better performance. However, video models require dense sampling in time to achieve accurate recognition. To fit in GPU memory, the frames to backbone network must be kept low-resolution, resulting in a coarse feature map in RoI-Pooling layer. Thus, we revisit RCNN for actor-centric action recognition via cropping and resizing image patches around actors before feature extraction with I3D deep network. Moreover, we found that expanding actor bounding boxes slightly and fusing the context features can further boost the performance. Consequently, we develop a surpringly effective baseline (Context-Aware RCNN) and it achieves new state-of-the-art results on two challenging action detection benchmarks of AVA and JHMDB. Our observations challenge the conventional wisdom of RoI-Pooling based pipeline and encourage researchers rethink the importance of resolution in actor-centric action recognition. Our approach can serve as a strong baseline for video action detection and is expected to inspire new ideas for this filed. The code is available at \url{https://github.com/MCG-NJU/CRCNN-Action}.

研究の動機と目的

  • アクション検出における標準的なRoI-Poolingパイプラインが、小さなアクター領域の入力解像度が低いために、判別的な空間的詳細を損なうかどうかを調査すること。
  • 小さなアクターのバウンディングボックスに起因する微細なアクション認識における性能低下を是正すること。
  • 局所的詳細を保持するとともに文脈的情報を活用する、シンプルで効果的なアクション検出のベースラインを開発すること。
  • アクター中心のアクション認識におけるRoI-Poolingの従来の常識を疑い、より効果的な代替手法を提案すること。

提案手法

  • 3D CNN(I3D)による特徴抽出の前に、元の動画フレームからのアクターのバウンディングボックスを固定された高解像度にクロップおよびリサイズする。
  • キーフレームで事前学習済みの人物検出器を用いてアクター候補を生成し、その後クロップされたパッチから特徴を抽出する。
  • 全動画クリップから抽出したシーン特徴と、簡素化された非局所モジュールから得た長期特徴を統合し、文脈理解を強化する。
  • 最終的なアクション分類のため、アクター特徴、シーン特徴、長期特徴を連結することで統合する。
  • 長距離時間的依存関係を捉えるために簡素化された非局所ブロックを適用し、標準的なプーリングよりも性能を向上させる。
  • 平均プーリングを特徴統合に用いる。これは注意メカニズムに基づく手法と同等の性能を発揮するが、計算コストが低くなる。

実験結果

リサーチクエスチョン

  • RQ1アクション検出におけるRoI-Poolingベースのパイプラインは、小さなアクター領域における空間的詳細の損失により、性能が著しく低下するのか?
  • RQ2クロップおよびリサイズによる小さなアクターの入力解像度の向上は、アクター中心のアクション検出における認識精度の向上に寄与するのか?
  • RQ3特にシーン特徴および長期特徴を含む文脈モデリングは、アクション検出性能の向上にどの程度効果的か?
  • RQ4高解像度のアクタークロップを用いたシンプルなRCNNパイプラインは、複雑な最先端モデルを上回る性能を発揮できるのか?

主な発見

  • アクターのバウンディングボックスが小さい場合、RoI-Poolingベースのパイプラインは顕著な性能低下を示し、解像度が低下するにつれてmAPが急激に低下する。
  • Context-Aware RCNNは、AVAデータセットで28.0%の新しいSOTA mAPを達成し、以前の最高手法(LFB)を2.2%上回る。
  • より小さなResNet-50バックボーンを用いても、より深いResNet-101を用いたLFBを上回る性能を発揮しており、高解像度入力の有効性が裏付けられる。
  • シーン特徴の追加によりmAPは24.7%から25.7%に向上し、長期特徴を統合することでさらに28.0%まで上昇する。
  • JHMDBデータセットでは、RGBフレームのみを用いて79.2%のmAPを達成し、このベンチマークで新たなSOTAを樹立する。
  • 簡素化された非局所モジュールは、標準的な注目メカニズムを上回り、より複雑な注目ブロックと同等の結果を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。