[論文レビュー] Learning Mid-level Words on Riemannian Manifold for Action Recognition
本稿では、グローバルアライメントを用いて密に抽出された低レベル特徴から中レベルのビジョナルワードを構築し、それらをリーマン多様体(部分空間、共分散、ガウス統計を介して)でモデル化する、新しいアクション認識フレームワークを提案する。ユークリッド空間に基づく符号化手法(BoVW、VLAD、FV)を、内在的コードブックを用いてリーマン多様体へ拡張し、YouTube、UCF50、HMDB51、ASLANデータセットで最先端の性能を達成した。従来の中レベル手法と比較して、高い精度に加え、より高速な計算を実現した。
Human action recognition remains a challenging task due to the various sources of video data and large intra-class variations. It thus becomes one of the key issues in recent research to explore effective and robust representation to handle such challenges. In this paper, we propose a novel representation approach by constructing mid-level words in videos and encoding them on Riemannian manifold. Specifically, we first conduct a global alignment on the densely extracted low-level features to build a bank of corresponding feature groups, each of which can be statistically modeled as a mid-level word lying on some specific Riemannian manifold. Based on these mid-level words, we construct intrinsic Riemannian codebooks by employing K-Karcher-means clustering and Riemannian Gaussian Mixture Model, and consequently extend the Riemannian manifold version of three well studied encoding methods in Euclidean space, i.e. Bag of Visual Words (BoVW), Vector of Locally Aggregated Descriptors (VLAD), and Fisher Vector (FV), to obtain the final action video representations. Our method is evaluated in two tasks on four popular realistic datasets: action recognition on YouTube, UCF50, HMDB51 databases, and action similarity labeling on ASLAN database. In all cases, the reported results achieve very competitive performance with those most recent state-of-the-art works.
研究の動機と目的
- 現実のアクション認識シナリオにおける大規模なクラス内変動と高次元な動画データを扱うため。
- 幾何的構造を有する中レベルのビジョナルワードを導入することで、表現のロバスト性と判別力を向上させるため。
- 中レベル特徴をリーマン多様体上にモデル化することで、内在的な統計的多様性をよりよく捉えるため。
- 標準的なユークリッド空間における符号化手法(BoVW、VLAD、FV)をリーマン空間へ拡張し、動画表現を向上させるため。
- 既存の中レベル表現手法よりも計算コストを低く抑えながら、最先端の性能を達成するため。
提案手法
- 全動画にわたる意味的対応を確立するため、普遍的なGMMを用いて、密に抽出された低レベル特徴(HOG、HOF、MBH)をグローバルアライメントする。
- アライメント済み特徴群を、3つの異なるリーマン多様体上に中レベルのワードとして統計モデル化する:線形部分空間(Grassmann)、共分散行列(SPD)、ガウス分布。
- リーマン幾何に適応したクラスタリングのため、K-Karcher平均を用いたクラスタリングとリーマン多様体上のガウス・ミックスチャネル・モデル(Riemannian GMM)を用いて、内在的リーマンコードブックを構築する。
- 地図距離とリーマン勾配を用いて、3つの標準的な符号化手法(Bag of Visual Words(BoVW)、Vector of Locally Aggregated Descriptors(VLAD)、Fisher Vector(FV))をリーマン多様体へ拡張する。
- 複数の中レベルワード表現(部分空間、共分散、ガウス)と記述子(HOG、HOF、MBH)を統合し、より高いロバスト性を実現する。
- 分類のため、最終的な動画表現を線形SVMに供給し、性能向上のためのラテントファージョンを用いる。
実験結果
リサーチクエスチョン
- RQ1低レベル特徴のグローバルアライメントは、中レベルワードの構築を改善し、現実世界の動画変動に起因するノイズを低減できるか?
- RQ2リーマン多様体モデル(Grassmann、SPD、ガウス)は、ユークリッド手法と比較して、中レベル特徴表現をどのように向上させるか?
- RQ3BoVW、VLAD、FVのリーマン拡張は、現実のデータセットにおけるアクション認識の正確性をどの程度向上させるか?
- RQ4複数の中レベルワードモデリング戦略を組み合わせることで、個別のアプローチよりも優れた性能が得られるか?
- RQ5提案手法は、既存の中レベル表現技術と比較して、より低い計算コストで最先端の結果を達成できるか?
主な発見
- YouTubeデータセットでは90.3%の正確度を達成し、従来の最先端手法を上回った。
- UCF50では90.7%の正確度を達成し、Action-Gons や Actons を含む既存の手法を上回った。
- HMDB51では56.4%の正確度を達成し、Action-parts や Motionlets といった先行の中レベル手法を顕著に上回った。
- ASLANにおけるアクション類似度ラベル付けでは、65.17%の正確度と70.29%のAUCを達成し、すべての従来の非教師ありベースラインを上回った。
- 平均して1動画あたり43.9秒の計算時間にまで短縮され、Motionlets(70秒)、Action-parts(227秒)、Action Bank(1156秒)と比較して顕著に高速化された。
- 記述子と中レベルワードモデルのラテントファージョンが、すべてのデータセットで最高の性能を達成した。これにより、マルチモーダルかつマルチ構造的表現の利点が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。