Skip to main content
QUICK REVIEW

[論文レビュー] Hyper-Fisher Vectors for Action Recognition

Sanath Narayan, Kalpathi Ramakrishnan|arXiv (Cornell University)|Sep 28, 2015
Human Pose and Action Recognition参考文献 31被引用数 3
ひとこと要約

本稿では、Bag-of-Words(BoW)コードブックから導出されたクラスタに対してFisher Vector(FV)符号化を別々に適用することで、従来のFisher Vector(FV)表現を向上させる、新しい動画行動認識符号化手法であるHyper-Fisher Vectors(HFV)を提案する。この手法は、UCF50、HMDB51、および他の複数のデータセットにおいて、2–3%の認識精度向上を達成し、HMDB51では3%の向上を示す。また、コードブックサイズの変動に対しても頑健であることが示された。

ABSTRACT

In this paper, a novel encoding scheme combining Fisher vector and bag-of-words encodings has been proposed for recognizing action in videos. The proposed Hyper-Fisher vector encoding is sum of local Fisher vectors which are computed based on the traditional Bag-of-Words (BoW) encoding. Thus, the proposed encoding is simple and yet an effective representation over the traditional Fisher Vector encoding. By extensive evaluation on challenging action recognition datasets, viz., Youtube, Olympic Sports, UCF50 and HMDB51, we show that the proposed Hyper-Fisher Vector encoding improves the recognition performance by around 2-3% compared to the improved Fisher Vector encoding. We also perform experiments to show that the performance of the Hyper-Fisher Vector is robust to the dictionary size of the BoW encoding.

研究の動機と目的

  • 動画行動特徴におけるクラス内変動を捉えることに失敗する標準Fisher Vector符号化の限界を克服すること。
  • 高いクラス内変動および環境変動を示す挑戦的なデータセットにおける行動認識性能を向上させること。
  • Bag-of-Wordsクラスタリングにおけるコードブックサイズの変化に対しても高い性能を維持できる、頑健な符号化方式を開発すること。
  • BoW構造をFVに埋め込むハイブリッド符号化戦略を導入し、より優れた特徴表現を実現すること。

提案手法

  • 密なトラジェクトリ特徴からk-meansクラスタリングを適用し、BoWコードブックを抽出する。これにより、特徴をクラスタ固有のグループに分割する。
  • 共有されたGMMを用いて各クラスタグループごとにFisher Vector符号化を独立して計算し、得られたベクトルを合算してHyper-Fisher Vectorを構築する。
  • 局所的特徴分布をモデル化し、FV符号化の勾配を計算するために、パラメータθ = {πₖ, μₖ, σₖ}を有する混合ガウスモデル(GMM)を用いる。
  • 最終的なHFV表現の識別性能を向上させるために、パワー正規化とL2正規化を適用する。
  • SVMと平均プーリングを用いた標準的な動画分類パイプラインに、HFV符号化を統合する。
  • カメラの動きや遮蔽に強く、改善された軌道特徴(例:Wangら[29]によるもの)を入力記述子として用いる。

実験結果

リサーチクエスチョン

  • RQ1BoWクラスタリングをFisher Vector符号化に埋め込むことで、挑戦的な動画データセットにおける行動認識性能が向上するか?
  • RQ2標準Fisher Vector符号化と比較して、提案されたHyper-Fisher Vector符号化は、精度および頑健性において優れているか?
  • RQ3BoWコードブックのサイズに依存して、Hyper-Fisher Vector符号化の性能がどの程度変動するか?
  • RQ4HFV表現は、標準FVと比較して、動画特徴におけるより判別性の高い変動を捉えているか?

主な発見

  • Hyper-Fisher Vector符号化は、Olympic Sports、YouTube、UCF50、HMDB51の各データセットにおいて、改善されたFisher Vectorベースラインより2–3%の認識精度向上を達成した。
  • HMDB51データセットでは、60.1%の精度を達成し、iDT+FVベースラインの57.2%と比較して3%の向上を示した。
  • 標準FVと比較して、HFV表現は平均偏差成分に広がったエネルギー分布を示しており、特徴の変動をより良いモデル化をしていることを示している。
  • HMDB51の50%以上の動画について、FV-HFV類似度スコアが0.85未満であった。これは、HFVとFVの間で顕著な表現差が存在することを示している。
  • コードブックサイズが500から4000に変化しても、HFVの性能は安定しており、精度の変動は1%未満にとどまる。これは、辞書サイズに対して強い頑健性を示している。
  • 評価されたすべてのデータセットにおいて、本手法は最新の深層学習を用いない手法を上回り、標準FV符号化の代替としての有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。