[論文レビュー] Viewpoint Invariant Action Recognition using RGB-D Videos
本稿では、RGBとDepthストリームからの視点不変特徴を統合することで、RGB-D動画を用いた視点不変行動認識手法を提案する。RGBの密な軌道に対して非線形知識移行を適用し、CNNベースのDepth特徴に対してフーリエ時系列ピラミッド符号化を施し、スパース・ドライビングな共同表現を用いて統合することで、精度を向上させ、標準データセット上での最近縁の手法よりも最大7.7%の精度向上を達成した。
In video-based action recognition, viewpoint variations often pose major challenges because the same actions can appear different from different views. We use the complementary RGB and Depth information from the RGB-D cameras to address this problem. The proposed technique capitalizes on the spatio-temporal information available in the two data streams to the extract action features that are largely insensitive to the viewpoint variations. We use the RGB data to compute dense trajectories that are translated to viewpoint insensitive deep features under a non-linear knowledge transfer model. Similarly, the Depth stream is used to extract CNN-based view invariant features on which Fourier Temporal Pyramid is computed to incorporate the temporal information. The heterogeneous features from the two streams are combined and used as a dictionary to predict the label of the test samples. To that end, we propose a sparse-dense collaborative representation classification scheme that strikes a balance between the discriminative abilities of the dense and the sparse representations of the samples over the extracted heterogeneous dictionary.
研究の動機と目的
- 異なる角度から見た同一行動の視覚的外観の不一致により性能が低下する、動画ベースの行動認識における視点変動の課題に対処する。
- RGB(外観と運動)とDepth(ポーズと構造)の相補的特徴をRGB-Dセンサから活用し、視点変動に対してより頑健な認識を実現する。
- 両モodalの別々の処理により、視点不変特徴を抽出し、カメラの角度に依存しない運動およびポーズ情報の保持を確保する。
- RGBおよびDepthストリームからの異種特徴の統合は、識別力の向上と視点不変性の維持を目的として設計されている。
- スパースおよびドライビング表現の両方の長所をバランスさせる、新たなスパース・ドライビング共同表現分類スキームを提案する。
提案手法
- RGB動画フレームから密な軌道を抽出し、運動および時系列ダイナミクスを符号化した後、Caffeを用いてスクラッチから学習された非線形知識移行モデルを適用し、視点不変深層特徴に変換する。
- Depthデータに対して、事前学習済みのCNNベースの人体ポーズモデル(HPM)を用いて、視点変動に強く、人体構造とポーズに焦点を当てた外観特徴を抽出する。
- CNN処理済みのDepth特徴に対して、フーリエ時系列ピラミッド(FTP)符号化を適用し、長距離時系列依存性をモデル化し、空間時系列表現を強化する。
- 得られたRGBおよびDepth特徴を正規化し、連結することで、異種の行動表現辞書を構築する。
- 統合された辞書上でのスパースおよびドライビングな共同表現の凸結合を実装し、テストサンプルを分類する。これにより、識別力と頑健性の両立が図られる。
- Caffeを用いた端末から端末への知識移行用の深層ネットワークを訓練するが、事前学習済みImageNet重みは使用しない。
実験結果
リサーチクエスチョン
- RQ1RGBおよびDepthストリームの共同処理は、単一モodalデータを用いる場合と比較して、行動認識における視点不変性を向上させることができるか?
- RQ2RGB動画の密な軌道からの非線形知識移行は、どの程度視点に依存しない特徴を生成できるか?
- RQ3CNNベースの人体ポーズ特徴とフーリエ時系列ピラミッド符号化の組み合わせは、Depthデータからの時系列ダイナミクスをどの程度効果的に捉えることができるか?
- RQ4異種RGB-D特徴統合の文脈において、スパース・ドライビング共同表現分類スキームは、純粋なスパースまたはドライビング表現を上回る性能を示すか?
- RQ5提案手法は、クロスサブジェクトおよびクロスビュー評価プロトコル下で、マルチビューRGB-D行動認識ベンチマークで最先端の性能を達成できるか?
主な発見
- クロスビュー評価下でUCF-101-24データセットにおいて92.9%の精度を達成し、最近縁の手法よりも7.7ポイント高い。
- NTU RGB+Dデータセットでは、クロスビュープロトコルで84.5%の精度を達成し、DSSCA-SSLMベースライン(74.9%)を9.6ポイント上回った。
- HDM05データセットにおいても、クロスビュー評価で82.7%の精度を達成し、多様なデータセットにわたり一貫した性能を示した。
- スパース・ドライビング共同表現スキームは、識別力と頑健性のバランスを効果的に実現し、視点変動に対する一般化性能の向上に寄与した。
- RGBおよびDepthストリームからの視点不変特徴の統合は、顕著な性能向上をもたらし、両モダリティの相補性を裏付けた。
- アブレーションスタディにより、提案された特徴抽出および統合パイプラインが不可欠であることが確認され、任意のコンponentを除去すると性能が顕著に低下した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。