Skip to main content
QUICK REVIEW

[論文レビュー] Searching Action Proposals via Spatial Actionness Estimation and Temporal Path Inference and Tracking

Nannan Li, Dan Xu|arXiv (Cornell University)|Aug 23, 2016
Human Pose and Action Recognition参考文献 28被引用数 5
ひとこと要約

本論文は、外見と動きの特徴を用いたフレームレベルのアクティビティスコア推定と、グリーディー最適化および検出に基づくトラッキングを用いた時間的パス推定を組み合わせた、新しい動画アクティビティプロポーザル生成フレームワークを提案する。Faster R-CNNを用いて人間のプロポーザルを取得し、動きをガウス・ミクスチャ・モデルでモデル化することで、UCF-Sportsで91.49%のリcallを達成し、1動画あたり12個のプロポーザルという非常に少ない数で、提案数を著しく削減しながらも、精度を向上させた。

ABSTRACT

In this paper, we address the problem of searching action proposals in unconstrained video clips. Our approach starts from actionness estimation on frame-level bounding boxes, and then aggregates the bounding boxes belonging to the same actor across frames via linking, associating, tracking to generate spatial-temporal continuous action paths. To achieve the target, a novel actionness estimation method is firstly proposed by utilizing both human appearance and motion cues. Then, the association of the action paths is formulated as a maximum set coverage problem with the results of actionness estimation as a priori. To further promote the performance, we design an improved optimization objective for the problem and provide a greedy search algorithm to solve it. Finally, a tracking-by-detection scheme is designed to further refine the searched action paths. Extensive experiments on two challenging datasets, UCF-Sports and UCF-101, show that the proposed approach advances state-of-the-art proposal generation performance in terms of both accuracy and proposal quantity.

研究の動機と目的

  • 制約のない動画において、高品質で空間的にコンパクトかつ時間的に連続するアクティビティプロポーザルを生成する課題に対処すること。
  • 従来のオブジェクトプロポーザル手法を越えて、人間の外見と動きの特徴を統合することで、フレームレベルのアクティビティスコア推定を向上させること。
  • 高いリcallを維持しつつ、アクティビティプロポーザルの数を最小限に抑えることで、計算複雑性を低減すること。
  • 時間的アクティビティパスの関連付けを、最適化されたグリーディーアルゴリズムを用いた最大セットカバレッジ問題として定式化すること。
  • 検出に失敗したフレームで欠落したプロポーザルを回復するために、検出に基づくトラッキング方式を用いてアクティビティパスを精緻化すること。

提案手法

  • Faster R-CNNモデルを、拡張されたアクティビティ検出データセットで微調整し、人間のプロポーザルを生成することで、フレームレベルのアクティビティスコア推定を実行する。
  • 各人間プロポーザルごとに、ガウス・ミクスチャ・モデルを用いて動きのパターンをモデル化し、動きに基づくアクティビティスコアを推定する。
  • 空間的および動きの類似性に基づいて、前向きおよび後向きの探索アルゴリズムにより、フレーム間のプロポーザルを結びつけて、空間的・時間的アクティビティパスを形成する。
  • アクティビティパスの関連付けを最大セットカバレッジ問題として定式化し、改善された最適化目的関数とグリーディー探索アルゴリズムを用いて解く。
  • 検出に失敗したフレームで欠落したプロポーザルを回復するために、検出に基づくトラッキング方式を適用してパスを精緻化する。
  • 本フレームワークはUCF-SportsおよびUCF-101で訓練および評価され、1フレームあたりの推論実行時間は1.69秒である。

実験結果

リサーチクエスチョン

  • RQ1制約のない動画において、外見と動きの特徴を統合することで、フレームレベルのアクティビティスコア推定が向上するか?
  • RQ2アクティビティパスの関連付けを最大セットカバレッジ問題として定式化することで、より良いプロポーザル品質と冗長性の低減が達成できるか?
  • RQ3改善された目的関数を用いたグリーディー探索アルゴリズムは、高リコールかつ低複雑性のアクティビティプロポーザルを生成するのにどの程度有効か?
  • RQ4検出に基づくトラッキングは、アクティビティパスの完全性と連続性をどの程度向上させるか?
  • RQ5多様なアクティビティクラスにおいて、最先端の手法と比較して、本手法はリコール、プロポーザル数、および頑健性の観点でどの程度優れているか?

主な発見

  • UCF-Sportsデータセットでは、IoU閾値0.5で91.49%のリコールを達成し、従来手法の最大89.36%を著しく上回った。
  • 本手法は1動画あたり平均で12個のアクティビティプロポーザルしか生成せず、従来の最先端手法が数百分の1000以上を生成するのと比べ、著しく削減された。
  • UCF-101では、63.76%のABOと39.64%のリコールを達成し、従来の最先端手法APT(40.77% ABO、35.45%リコール)を上回った。
  • Biking、Surfing、TrampoliningJumpingなどの困難なアクティビティクラスにおいて、本手法はベースライン手法を著しく上回る優れた性能を示した。
  • 高いIoU閾値(例:0.7)でも、リコールが0.7以上を維持したのに対し、従来手法は同条件で0.4未満に低下した。
  • 実行時間分析の結果、1フレームあたりの平均推論時間は1.69秒であり、うち1秒がアクティビティスコア推定、0.09秒がパス推定、0.5秒がパス完成処理に要した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。