Skip to main content
QUICK REVIEW

[論文レビュー] Long-short Term Motion Feature for Action Classification and Retrieval

Zhenzhong Lan, Xuanchong Li|arXiv (Cornell University)|Feb 13, 2015
Human Pose and Action Recognition参考文献 23被引用数 6
ひとこと要約

本論文では、複数の長さの動画ブロックから局所的運動記述子を抽出することにより、動画行動分類および検索を向上させる、シンプルでありながら効果的な方法であるLong-Short Term Motion Feature (LSTMF) を提案する。短い、中程度の、長い時間的セグメントからの特徴を組み合わせることで、固定長ブロック手法よりも、速い動きと遅い動きの両方をより効果的に捉えることができる。Improved Dense Trajectory (IDT) をベースモデルとして用いることで、HMDB51、Hollywood2、UCF50、Olympics Sports データセットにおいて、最先端の性能を達成した。

ABSTRACT

We propose a method for representing motion information for video classification and retrieval. We improve upon local descriptor based methods that have been among the most popular and successful models for representing videos. The desired local descriptors need to satisfy two requirements: 1) to be representative, 2) to be discriminative. Therefore, they need to occur frequently enough in the videos and to be be able to tell the difference among different types of motions. To generate such local descriptors, the video blocks they are based on must contain just the right amount of motion information. However, current state-of-the-art local descriptor methods use video blocks with a single fixed size, which is insufficient for covering actions with varying speeds. In this paper, we introduce a long-short term motion feature that generates descriptors from video blocks with multiple lengths, thus covering motions with large speed variance. Experimental results show that, albeit simple, our model achieves state-of-the-arts results on several benchmark datasets.

研究の動機と目的

  • 異なる動きの速度を持つアクティビティを表現する際、固定長の動画ブロックの制限を克服すること。
  • 動画分類および検索における局所的運動記述子の判別力および代表的質を向上させること。
  • アーキテクチャの変更なしに、既存の動画記述子手法に適用可能な汎用的な向上手法を開発すること。
  • マルチスケール時間的プーリングによる記述子の性能向上が、ベンチマークデータセットにおいて顕著に顕在することを示すこと。

提案手法

  • 本手法は、1つの固定長ではなく、さまざまな長さ(例:15、30、45、60、75、90 フレーム)の動画ブロックから局所的スパatiotemporal特徴を抽出する。
  • 各動画に対して、空間的および時間的整合性を保ちつつ、異なる時間的範囲を持つ複数の動画ブロックが生成される。
  • 各ブロックから局所的記述子(例:HOF、MBH)が抽出され、その後、ピラミッドアグリゲーション戦略を用いて、すべてのブロック長にわたってプーリングされる。
  • 最終的な表現は、すべてのブロックサイズからの特徴を組み合わせることで、多様な動き速度を持つアクティビティのカバー範囲が向上する。
  • 本手法は、Improved Dense Trajectory (IDT) フレームワーク上に適用され、同じエンコードおよびプーリングパイプラインを維持する。
  • 本手法は、任意の記述子ベースの動画表現システムと互換性があり、即挿し可能な設計である。

実験結果

リサーチクエスチョン

  • RQ1マルチスケール時間的ブロックサイズは、動画行動認識における局所的運動記述子の代表的および判別的質を向上させることができるか?
  • RQ2短いおよび長い動画セグメントからの特徴を組み合わせることで、動き速度が変動するデータセットにおいて、性能が向上するか?
  • RQ3LSTMFの性能は、単一長さブロック手法および最先端のアプローチと比較して、多様なベンチマークデータセットでどのように異なるか?
  • RQ4ブロック長の選定が、特徴カバレッジおよびモデルの正確性に与える影響は何か、特に短時間の動画においては?

主な発見

  • LSTMF においてブロック長 l=90 を使用した場合、HMDB51 で平均 63.7% の正確度を達成し、以前の最先端の 61.1% を上回った。
  • Hollywood2 では、LSTMF が 68.2% の MAP を達成し、以前の最高の 64.3% を上回った。
  • UCF50 では、LSTMF が 93.7% の平均正確度を達成し、以前の最先端の 91.2% を上回った。
  • Olympics Sports データセットでは、LSTMF が 91.4% の MAP を達成し、以前の最高の 91.1% をわずかに上回った。
  • LSTMF の性能は、ブロック長が増加するにつれて一貫して向上し、データセット全体にわたって高いロバスト性とスケーラビリティを示した。
  • 本手法は、特に動きの速度分散が大きい動画において、マルチスケールブロックプーリングが記述子の質を顕著に向上させることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。