Skip to main content
QUICK REVIEW

[論文レビュー] Human Action Recognition using Local Two-Stream Convolution Neural Network Features and Support Vector Machines

David Torpey, Turgay Çelik|arXiv (Cornell University)|Feb 19, 2020
Human Pose and Action Recognition参考文献 25被引用数 5
ひとこと要約

本稿では、RGBおよびオプティカルフロー入力からの局所的空間時間的特徴を用いて、2ストリームCNN特徴抽出法と線形SVMを組み合わせた人間行動認識手法を提案する。オプティカルフローのスケーリングとクロップフィリングの前処理を適用し、全動画の文脈を用いてSVMを訓練することで、特にHMDB51やUCF101のような複雑なデータセットにおいて顕著な精度向上を達成した。これは、グローバルなSVM統合が単純なクロップレベルの投票よりも優れていることを示している。

ABSTRACT

This paper proposes a simple yet effective method for human action recognition in video. The proposed method separately extracts local appearance and motion features using state-of-the-art three-dimensional convolutional neural networks from sampled snippets of a video. These local features are then concatenated to form global representations which are then used to train a linear SVM to perform the action classification using full context of the video, as partial context as used in previous works. The videos undergo two simple proposed preprocessing techniques, optical flow scaling and crop filling. We perform an extensive evaluation on three common benchmark dataset to empirically show the benefit of the SVM, and the two preprocessing steps.

研究の動機と目的

  • 大規模な計算リソースを要せず、深層特徴を用いて人間行動認識のパフォーマンスを向上させること。
  • 局所的クロップ特徴から得られるグローバルな全動画表現を用いて線形SVMを訓練することで、クロップレベルの予測のコンSENSUS投票よりも性能が向上するかを調査すること。
  • オプティカルフローのスケーリングとクロップフィリングという2つの単純な前処理技術が、多様なデータセットにおける認識精度に与える影響を評価すること。
  • 提案手法が、従来のエンジニアリング手法や深層学習手法と比較して、複雑で現実世界の行動データセットにおいてより優れた一般化性能を示すことを実証すること。

提案手法

  • RGBおよびオプティカルフロー入力の両方に対して、事前に訓練済みのI3Dネットワークを用いて、サンプリングされた動画スニペットから局所的空間時間的特徴を抽出する。
  • オプティカルフローのスケーリングを適用してフローの大きさを正規化し、異なる運動強度を持つ動画間での特徴の一貫性を向上させる。
  • 短いクリップを固定長にパディングすることで、変動する動画長に対処するためのクロップフィリングを用いる。これにより、時間的文脈が保持される。
  • すべてのクロップからの局所的特徴を連結してグローバルな動画表現を構築し、分類に適した固定長のベクトルを形成する。
  • 分類のために、クロップレベルの投票ではなく、全動画の文脈を用いてグローバル特徴表現上で線形SVMを訓練する。
  • KTH、HMDB51、UCF101の3つのデータセットで標準的な分割と評価指標を用いて評価を行い、前処理および分類器の選択に関するアブレーションスタディも実施する。

実験結果

リサーチクエスチョン

  • RQ1局所的クロップ特徴から得られるグローバルな全動画表現を用いて線形SVMを訓練することで、クロップレベルの予測の多数決投票と比較して、行動認識の精度が向上するか?
  • RQ2オプティカルフローのスケーリングとクロップフィリングという前処理技術が、行動の時間的類似性が異なるデータセットにおける認識性能に与える影響は何か?
  • RQ3標準的なI3D特徴とSVMを用いた軽量で効率的な手法が、高価なハードウェアや大規模データセットを必要とせずに、ベンチマークデータセットで競争力のあるパフォーマンスを達成できるか?
  • RQ4提案手法は、従来の最先端手法と比較して、HMDB51 や UCF101 のような複雑で現実世界の行動データセットにおいて、より優れた一般化性能を示すか?

主な発見

  • 提案された全動画文脈に基づくSVM分類は、単純なクロップレベルの投票よりも顕著に優れており、特に空間的・時間的文脈が重要となるような複雑なデータセット(HMDB51 や UCF101)において顕著な向上が見られた。
  • KTHデータセットでは、最高平均精度96.6%を達成し、1つの最先端手法を除いて、ほとんどの先行手法を上回った。
  • HMDB51データセットでは、最高平均精度62.8%を達成し、限られた空間的・時間的分解能にもかかわらず、強力な一般化性能を示した。
  • UCF101データセットでは、SVMと前処理を適用したことで86.5%の精度を達成し、ベースラインから6ポイントの向上を示した。
  • オプティカルフローのスケーリングとクロップフィリングは、KTHやHMDB51において、行動がより時間的に類似しているため性能向上をもたらしたが、UCF101では行動間の時間的類似性が低いため、ほとんど利益が得られなかった。
  • アブレーションスタディにより、両方の前処理ステップおよびSVM統合戦略が、特に困難で現実世界の設定において性能向上の主な要因であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。