Skip to main content
QUICK REVIEW

[論文レビュー] Learning and Refining of Privileged Information-based RNNs for Action Recognition from Depth Sequences

Zhiyuan Shi, Tae‐Kyun Kim|arXiv (Cornell University)|Mar 28, 2017
Human Pose and Action Recognition参考文献 46被引用数 8
ひとこと要約

本稿では、深度シーケンスからの行動認識のための特権情報に基づくRNN(PRNN)を提案する。訓練時における骨格関節を特権情報(PI)として活用することで、特徴の学習と一般化性能を向上させる。本手法は3段階のプロセスを経る—深度とPIを用いた事前学習、PIを補助タスクとして活用するマルチタスク学習、および潜在的PIと分類出力の整合性を図るブリッジ行列による精練—これにより、複数のベンチマーク、特に新規に収集したデータセットにおいて最先端の性能を達成し、汎用的CNN-RNNよりも最大15.7%の向上を達成した。

ABSTRACT

Existing RNN-based approaches for action recognition from depth sequences require either skeleton joints or hand-crafted depth features as inputs. An end-to-end manner, mapping from raw depth maps to action classes, is non-trivial to design due to the fact that: 1) single channel map lacks texture thus weakens the discriminative power; 2) relatively small set of depth training data. To address these challenges, we propose to learn an RNN driven by privileged information (PI) in three-steps: An encoder is pre-trained to learn a joint embedding of depth appearance and PI (i.e. skeleton joints). The learned embedding layers are then tuned in the learning step, aiming to optimize the network by exploiting PI in a form of multi-task loss. However, exploiting PI as a secondary task provides little help to improve the performance of a primary task (i.e. classification) due to the gap between them. Finally, a bridging matrix is defined to connect two tasks by discovering latent PI in the refining step. Our PI-based classification loss maintains a consistency between latent PI and predicted distribution. The latent PI and network are iteratively estimated and updated in an expectation-maximization procedure. The proposed learning process provides greater discriminative power to model subtle depth difference, while helping avoid overfitting the scarcer training data. Our experiments show significant performance gains over state-of-the-art methods on three public benchmark datasets and our newly collected Blanket dataset.

研究の動機と目的

  • 単一チャネルの深度マップにおける行動認識のための判別力の不足に寄与する課題に対処すること。
  • 訓練時に特権情報(PI)を活用することで、小規模な深度データセットにおける過学習を軽減すること。
  • 推論時に骨格追跡を必要としない、生の深度マップからのエンドツーエンド学習を可能にすること。
  • 外見特徴と骨格ベースのPIとの間のドメインギャップを、反復的精錬によって是正すること。
  • 深度ベースの行動認識ベンチマークにおけるモデルの一般化性能と性能を向上させること。

提案手法

  • 外見とPIの両方の埋め込みを学習するために、深度シーケンスと骨格関節を入力として用いたCNN-RNNエンコーダーを事前学習する。
  • 分類損失(主タスク)と予測された骨格関節の回帰損失(補助タスク、PIとしての役割)を組み合わせたマルチタスク損失を用いてエンコーダーを微調整する。
  • 精錬段階でブリッジ行列を導入し、予測された骨格関節の分布と分類出力の分布を一致させる潜在的PIを発見する。
  • PIに基づく分類損失を導入し、潜在的PIと予測クラス分布の整合性を保証する。この損失は分布違反をペナルティ化する。
  • 期待値最大化(EM)手順を用いて、ブリッジ行列、潜在的PI、およびネットワークパラメータを同時に最適化する。
  • 最終的なモデルは、実時間の骨格追跡を必要とせず、深度マップのみを入力として推論に使用する。

実験結果

リサーチクエスチョン

  • RQ1訓練時に特権情報(骨格関節)を効果的に活用することで、深度シーケンスからの行動認識が向上するか?
  • RQ2マルチタスク学習においてPIを補助タスクとして活用することで、主タスクの分類性能が顕著に向上するか?
  • RQ3潜在的PIを発見するブリッジ行列が、外見表現と骨格表現との間のドメインギャップを是正できるか?
  • RQ4反復的EMベースの精錬プロセスが、小規模な深度データセットにおけるモデルの一般化性能を向上させ、過学習を低減するか?
  • RQ5提案手法はエンドツーエンド学習とリアルタイム推論を維持しながら、最先端の性能を達成できるか?

主な発見

  • 提案されたPRNNモデルはAction3Dで94.9%の精度を達成し、ベースラインのvanilla CNN-RNN(87.3%)を7.6ポイント上回った。
  • SBUデータセットでは89.2%の精度を達成し、ベースラインより10.0ポイントの向上を達成した。
  • CAD60では87.6%の精度を達成し、vanilla CNN-RNNより6.1ポイントの向上を達成した。
  • 新たに収集したBlanketデータセットでは53.5%の精度を達成し、ベースラインより15.7ポイントの向上を達成した。
  • アブレーションスタディの結果、事前学習、マルチタスク学習、潜在的PIを用いた精錬という各コンポonentが性能向上に顕著に寄与することが確認された。
  • 1枚のGPU上で約38 FPSのリアルタイム推論を達成しており、3段階の訓練プロセスを経ても計算効率が高く、実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。