Skip to main content
QUICK REVIEW

[論文レビュー] An end-to-end generative framework for video segmentation and recognition

Hilde Kuehne, Jüergen Gall|arXiv (Cornell University)|Sep 7, 2015
Human Pose and Action Recognition参考文献 31被引用数 5
ひとこと要約

この論文は、動画の行動セグメンテーションと認識のため、縮小されたフィッシャー・ベクトル(FVs)と隠れマルコフモデル(HMMs)を組み合わせたエンド・ツー・エンドの生成的フレームワークを提案する。FVsの統計的性質を活用してガウス・ミックスチャネル・モデル(GMMs)による効率的なモデリングを可能にし、十分な訓練データが利用可能な場合、認識精度が最大30%向上するという最先端の性能を達成した。

ABSTRACT

We describe an end-to-end generative approach for the segmentation and recognition of human activities. In this approach, a visual representation based on reduced Fisher Vectors is combined with a structured temporal model for recognition. We show that the statistical properties of Fisher Vectors make them an especially suitable front-end for generative models such as Gaussian mixtures. The system is evaluated for both the recognition of complex activities as well as their parsing into action units. Using a variety of video datasets ranging from human cooking activities to animal behaviors, our experiments demonstrate that the resulting architecture outperforms state-of-the-art approaches for larger datasets, i.e. when sufficient amount of data is available for training structured generative models.

研究の動機と目的

  • 長時間の動画記録における複雑で順序的な人間の行動を認識する際の、非構造的モデルの限界を克服すること。
  • フィッシャー・ベクトルのような高次元でスパースな視覚特徴と、HMM や GMM などの構造的生成モデルとの互換性を向上させること。
  • 十分な訓練データが利用可能な場合、構造的生成モデルが判別的ベースラインを上回ることを示すこと。
  • 人間の日常行動や動物行動を含む多様な動画データセットに対して、提案されたフレームワークを体系的に評価すること。
  • 縮小されたFVsが、時系列モデリングタスクにおける認識およびセグメンテーションの精度を向上させること

提案手法

  • 本手法は、動画クリップから導出されるコンactで低次元の視覚的表現としての縮小されたフィッシャー・ベクトルを用い、GMMとの適合性を向上させる。
  • HTKツールキットを用いて訓練される、時系列モデリングを目的とした構造的時系列モデル(HMM)を採用する。
  • GMMと縮小されたFVsを統合し、FVsがガウス・ミックスチャネルモデリングに適している統計的性質を活用する。
  • 特徴抽出にはHOGHOFと密度トラジェクトリーフィーチャー(DTFs)を用い、空間ピラミッドプーリングとL2正規化を適用して表現のコンパクト性を向上させる。
  • 複雑な行動の認識および時系列的セグメンテーションの両方に対して、エンド・ツー・エンドの訓練と推論を実行する。
  • 評価には、ADL、Breakfast、MPII Cooking、CRIM13を含む複数のデータセットにおける標準ベンチマークを用い、フレーム単位およびセグメント単位の精度指標を用いる。

実験結果

リサーチクエスチョン

  • RQ1縮小されたフィッシャー・ベクトルは、HMM などの構造的生成モデルの動画行動認識性能を向上させることができるか?
  • RQ2提案されたエンド・ツー・エンドの生成的フレームワークは、大規模な動画データセットにおいて判別的ベースラインを上回るか?
  • RQ3複雑な行動を行動ユニットにセグメンテーションする際、本システムは最先端の手法と比較してどの程度の性能を示すか?
  • RQ4どの程度のデータサイズの条件下で、構造的生成モデルが動画認識タスクにおいて判別的モデルを上回るか?
  • RQ5フィッシャー・ベクトルの統計的性質が、時系列行動認識におけるGMMベースのモデリングをどの程度向上させるか?

主な発見

  • 十分な訓練データが利用可能な場合、縮小されたFVsとHMMを組み合わせた本フレームワークは、Breakfast や CRIM13 データセットなどの大規模データセットで、最先端の手法を約20–30%上回る認識精度を達成した。
  • Breakfast データセットでは、256個のGMM成分を用いて98.7%の認識精度を達成し、[12]で報告された過去の最先端の40.5%を大きく上回った。
  • セグメンテーションの観点では、CRIM13 データセットで最高のベースライン比27.5%の改善を示し、長時間で連続する動画シーケンスにおいても優れた性能を発揮した。
  • ADL や Olympics のような小規模データセットでは性能が劣ることから、性能向上はデータ依存であり、十分な訓練サンプルが必要であることが示された。
  • フルFVsを用いたSVMベースの分類は、縮小FVsを上回ったが、依然としてHTKベースのHMMシステムには20–30%の精度差を示し、構造的モデリングの利点を裏付けた。
  • 結果から、十分なデータが利用可能な場合、構造的生成モデルが判別的モデルを上回ることを確認した。これは、低データ環境では判別的モデルが優勢であったという従来の傾向を逆転させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。