Skip to main content
QUICK REVIEW

[論文レビュー] Three Branches: Detecting Actions With Richer Features

Xia Jin, Jiajun Tang|arXiv (Cornell University)|Aug 13, 2019
Human Pose and Action Recognition参考文献 18被引用数 6
ひとこと要約

本論文は、SlowFastバックボーンとLong-Term Feature Bank (LFB) を用いて、グローバルな動画クリップ特徴、短時間の人間領域特徴、および長時間の時間的特徴を融合する三本の分岐からなるフレームワークを提案する。この手法により、アクション検出性能が向上し、Kinetics-700 では 21.59% の誤差率、AVA では 32.49% の mAP を達成した。これは 2018 年の AVA 提出物すべてを 10% 以上の mAP の差で上回った。

ABSTRACT

We present our three branch solutions for International Challenge on Activity Recognition at CVPR2019. This model seeks to fuse richer information of global video clip, short human attention and long-term human activity into a unified model. We have participated in two tasks: Task A, the Kinetics challenge and Task B, spatio-temporal action localization challenge. For Kinetics, we achieve 21.59% error rate. For the AVA challenge, our final model obtains 32.49% mAP on the test sets, which outperforms all submissions to the AVA challenge at CVPR 2018 for more than 10% mAP. As the future work, we will introduce human activity knowledge, which is a new dataset including key information of human activity.

研究の動機と目的

  • 複数のレベルの動画理解から得られるより豊かな空間時間的特徴を統合することで、アクション検出性能を向上させること。
  • Long-Term Feature Banks (LFB) を用いて長期間の時間的依存関係を組み込むことで、短時間モデルの限界を補完すること。
  • グローバルなクリップレベル特徴、局所的な人間の外見特徴、および長期間の動きパターンを統合することで、特徴表現を強化すること。
  • Kinetics-700 動作認識および AVA 空間時間的アクション局所化ベンチマークの両方で最先端の結果を達成すること。
  • トレーニング中にファーカスロスを用いることで、アクションデータセットのクラス不均衡を克服し、レアアクションの認識を向上させること。

提案手法

  • 64 フレームのクリップから空間時間的特徴を抽出するために、SlowFast 3D CNN バックボーンを用いる。スローパathウェイは 8 フレーム、ファストパスウェイは 32 フレームの入力を使用する。
  • キーフレーム(各秒の中央)でのみ人間のバウンディングボックスを検出するために、ResNeXt-101-FPN バックボーンを搭載した Faster R-CNN を適用する。得られたバウンディングボックスを用いて、短時間の人間特徴を切り出す。
  • 3D リジョンオブインタレスト (RoI) プーリングを用いて、検出されたバウンディングボックスを基に、クリップレベル特徴から局所的な人間特徴を抽出する。
  • 長期間の時間的依存関係を捉えるために、Long-Term Feature Banks (LFB) を導入。時間ステップに跨る特徴を格納・取得することで実現する。
  • 最終分類器によるアクション予測の前に、グローバルなクリップ特徴、短時間の人間特徴、および長期間の LFB 特徴を連結する。
  • 特にスイミングやクローリングのようなレアアクションの認識を向上させるために、クラス不均衡を解消する目的でファーカスロスを用いる。

実験結果

リサーチクエスチョン

  • RQ1グローバル特徴、局所的人間領域特徴、および長期間の時間的特徴を統合することで、複雑な動画データセットにおけるアクション検出性能が向上するか?
  • RQ2Long-Term Feature Banks (LFB) を用いて長期間の時間的モデリングを組み込むと、空間時間的アクション局所化における認識精度にどのような影響を与えるか?
  • RQ3Kinetics-700 のような大規模データセットで事前学習することで、下流のアクション検出性能がどの程度向上するか?
  • RQ4標準的なクロスエントロピー損失と比較して、三本の分岐アーキテクチャは、クラス不均衡なアクション認識に対してどの程度効果的か?
  • RQ5統一されたモデルが、短時間の外見・運動特徴と長期間の文脈を効果的に統合し、アクション検出性能を向上させられるか?

主な発見

  • 提案された三本の分岐モデルは、Kinetics-700 テストセットで平均トップ-1 およびトップ-5 誤差率が 21.59% に達し、大規模なアクション認識において優れた性能を示した。
  • AVA データセットでは 32.49% の mAP を達成し、2018 年の AVA チャレンジへのすべての提出物を 10 パcentage ポints 以上上回った。
  • Kinetics-700 で事前学習された SlowFast ネットワークを微調整することで、性能が顕著に向上した。これは、より大規模な事前学習の利点を示している。
  • ファーカスロスの使用により、稀なアクションクラスにおける一般化性能が向上し、長尾分布のアクション認識においても耐性が向上した。
  • マルチスケールのテスト補正と水平反転により、多様な動画入力に対して予測が安定し、mAP が向上した。
  • LFB 特徴の統合により、複数のクリップに跨る長時間のアクションの認識が顕著に向上し、特に複雑なシーンにおいて顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。