[論文レビュー] RGB Video Based Tennis Action Recognition Using a Deep Weighted Long Short-Term Memory.
本稿では、事前学習済みInception CNN特徴量と組み合わせた深層重み付きLong Short-Term Memory(LSTM)ネットワークを用いて、RGB動画に基づくテニス行動認識の新規手法を提案する。個々のフレームからの空間的CNN表現と、時間的依存関係をモデル化するスコア重み付きLSTMデコーダーを活用することで、原始的なRGB動画入力のみで、ベンチマークデータセットにおいて最先端の性能を達成する。
Action recognition has attracted increasing attention from RGB input in computer vision partially due to potential applications on somatic simulation and statistics of sport such as virtual tennis game and tennis techniques and tactics analysis by video. Recently, deep learning based methods have achieved promising performance for action recognition. In this paper, we propose weighted Long Short-Term Memory adopted with convolutional neural network representations for three dimensional tennis shots recognition. First, the local two-dimensional convolutional neural network spatial representations are extracted from each video frame individually using a pre-trained Inception network. Then, a weighted Long Short-Term Memory decoder is introduced to take the output state at time t and the historical embedding feature at time t-1 to generate feature vector using a score weighting scheme. Finally, we use the adopted CNN and weighted LSTM to map the original visual features into a vector space to generate the spatial-temporal semantical description of visual sequences and classify the action video content. Experiments on the benchmark demonstrate that our method using only simple raw RGB video can achieve better performance than the state-of-the-art baselines for tennis shot recognition.
研究の動機と目的
- 原始的なRGB動画入力のみを用いて、テニス動画における行動認識を向上させること。
- 正確なショット分類のための動画シーケンスにおける長距離時間的依存関係をモデル化する課題に対処すること。
- 空間的特徴と順序的ダイナミクスの両方を捉える、空間的・時間的表現学習フレームワークを開発すること。
- ベンチマークデータセットにおいて、既存の最先端手法よりも優れた性能を達成すること。
提案手法
- 2次元CNN表現として、事前学習済みInceptionネットワークを用いて各動画フレームから空間的特徴量を抽出する。
- 現在の状態と履歴の埋め込みを用いて文脈に配慮した特徴ベクトルを生成する、重み付きLong Short-Term Memory(LSTM)デコーダーを採用する。
- 時間的シーケンスモデリング中に、履歴隠れ状態への重要度を動的に割り当てるスコア重み付け方式を適用する。
- CNNと重み付きLSTMの統合アーキテクチャにより、視覚的特徴量を共同の空間的・時間的ベクトル空間にマッピングし、行動分類に用いる。
- 原始的なRGB動画シーケンスに基づいて、三次元のテニスショットを分類するようにモデルを訓練する。
実験結果
リサーチクエスチョン
- RQ1CNN特徴量と組み合わせた重み付きLSTMは、テニス動画シーケンスにおける行動認識のための時間的ダイナミクスを効果的にモデル化できるか?
- RQ2本手法は、RGB動画テニスショット認識の文脈で、最先端の手法と比較してどの程度の精度を達成するか?
- RQ3オプティカルフローまたは追加のモダリティ入力なしに、原始的なRGB動画のみで高い性能を達成できるか、その限界は何か?
- RQ4LSTMにおけるスコア重み付け機構は、標準的なLSTMアーキテクチャと比較して、特徴表現学習をどのように向上させるか?
主な発見
- 提案手法は、ベンチマークデータセットにおけるテニスショット認識において、最先端のベースラインを上回る性能を達成した。
- オプティカルフローまたは追加の入力モダリティを必要とせず、原始的なRGB動画のみで強力な一般化性能を示した。
- 事前学習済みInception特徴量と重み付きLSTMの統合により、空間的・時間的特徴表現学習が向上した。
- LSTMにおけるスコア重み付け機構により、関連する履歴状態に注目する能力が向上し、時間的モデリングが強化された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。