Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Embedding Space for Zero-Shot Action Recognition

Xun Xu, Timothy M. Hospedales|arXiv (Cornell University)|Feb 5, 2015
Human Pose and Action Recognition参考文献 10被引用数 17
ひとこと要約

本稿では、ゼロショット動画行動認識のための意味的埋め込み空間(SES)フレームワークを提案する。word2vecを用いて行動ラベルを共有のベクトル空間にマッピングし、サポートベクターレグレッションを用いて動画特徴をこの空間に投影する。HMDB51およびUCF101の両データセットにおいて自己学習とデータ拡張を組み合わせることで、最先端のゼロショット精度(HMDB51で21.2%、UCF101で18.6%)を達成し、従来の属性ベースおよびベースラインSES手法を著しく上回る性能を示した。

ABSTRACT

The number of categories for action recognition is growing rapidly. It is thus becoming increasingly hard to collect sufficient training data to learn conventional models for each category. This issue may be ameliorated by the increasingly popular 'zero-shot learning' (ZSL) paradigm. In this framework a mapping is constructed between visual features and a human interpretable semantic description of each category, allowing categories to be recognised in the absence of any training data. Existing ZSL studies focus primarily on image data, and attribute-based semantic representations. In this paper, we address zero-shot recognition in contemporary video action recognition tasks, using semantic word vector space as the common space to embed videos and category labels. This is more challenging because the mapping between the semantic space and space-time features of videos containing complex actions is more complex and harder to learn. We demonstrate that a simple self-training and data augmentation strategy can significantly improve the efficacy of this mapping. Experiments on human action datasets including HMDB51 and UCF101 demonstrate that our approach achieves the state-of-the-art zero-shot action recognition performance.

研究の動機と目的

  • トレーニングデータが一切ない新しい動画行動を認識するという課題に取り組む。これは、行動カテゴリの複雑性の急激な増加とデータ収集コストの上昇に伴い、顕著な問題となっている。
  • 従来、主に画像認識で用いられてきた意味的埋め込み空間(SES)のパラダイムを、視覚的・意味的マッピングがより複雑である動画行動認識へと拡張すること。
  • 視覚的特徴から意味的空間へのレグレッションのロバスト性と転送性を向上させることで、ゼロショット動画認識におけるドメインシフトと一般化の課題を克服すること。
  • 自己学習とデータ拡張という単純な戦略が、SESベースのゼロショット行動認識の性能を著しく向上させられることを示すこと。
  • ゼロショット設定に加え、通常のマルチショット学習設定でもフレームワークの有効性を検証し、教師あり設定でも競争力のある性能を示すこと。

提案手法

  • 1000億語のコーパスで事前学習されたword2vecを用い、クラス名を$d_z$次元の意味的空間に埋め込む。複数語のラベルは平均化して1つのベクトルに統合する。
  • サポートベクターレグレッション(SVR)を用いて、低レベルの時空間特徴(例:MBH、HOG)から意味的埋め込み空間へのマッピング$f: x \to z$を学習する。
  • データ拡張として、ターゲットデータセット(例:HMDB51)と補助データセット(例:UCF101)を同時に学習することで、異なるドメイン間での一般化性を向上させる。
  • 自己学習を導入し、初期レグレッサーからの予測を用いて意味的空間内のプロトタイプ表現を改善することで、未学習の行動カテゴリのインスタンスとそのプロトタイプとの整合性を高める。
  • t-SNE可視化を用いて、拡張されたデータと自己学習が未学習クラスのサンプルをそのプロトタイプの周囲により緊密にクラスタリングすることを定性的に検証する。
  • ゼロショットおよびマルチショット評価の両方で標準的な訓練/テスト分割を用い、意味的空間内での最近傍法マッチングによる分類を実施する。

実験結果

リサーチクエスチョン

  • RQ1時空間特徴を意味的ベクトルにマッピングするという複雑さを考慮しても、意味的埋め込み空間がゼロショット動画行動認識に有効に活用できるか?
  • RQ2複数のデータセット(例:HMDB51とUCF101)を横断したデータ拡張は、ゼロショット認識における視覚的・意味的レグレッサーの一般化性をどのように向上させるか?
  • RQ3自己学習は意味的空間内のプロトタイプ表現をどの程度改善し、未学習の行動カテゴリにおける性能向上に寄与するか?
  • RQ4従来の属性ベースのZSL手法と比較して、提案手法のSESベースのアプローチは、ゼロショット精度とスケーラビリティの面でどのように優れているか?
  • RQ5同じ意味的埋め込みフレームワークは、標準的なマルチショット教師あり行動認識でも競争力のある性能を達成できるか?

主な発見

  • 提案手法は、HMDB51で平均21.2% ± 3.0%の精度を達成し、最先端のゼロショット行動認識性能を実現した。これは、ベースラインのNN手法(15.0% ± 3.0%)および属性ベース手法(DAP:UCF101で14.3% ± 1.9%)を著しく上回る。
  • UCF101では18.6% ± 2.2%のゼロショット精度を達成し、NN+STベースライン(15.8% ± 2.3%)およびDAP手法(14.3% ± 1.9%)を上回った。
  • データ拡張と自己学習の組み合わせ(NN+ST+Aux)が最も高い性能を示し、両戦略が未学習の行動カテゴリへの堅牢な一般化に不可欠であることを示した。
  • 定性的なt-SNE可視化から、データ拡張により未学習クラスのインスタンスとそのプロトタイプとの距離が短縮され、自己学習によりさらにプロトタイプの整合性が向上していることが確認された。
  • マルチショット学習では、HMDB51で44.5%、UCF101で73.7%の精度を達成し、低レベル特徴に基づく最先端手法(HMDB51で47.2%)と同等の性能を示した。属性ベース手法(UCF101で69.7%)を上回った。
  • 結果から、自己学習とデータ拡張を組み合わせた意味的埋め込み空間は、特に複雑な動画行動に対して、属性ベースのZSLとは対照的にスケーラブルで効果的な代替手法であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。