[論文レビュー] CNN-based Action Recognition and Supervised Domain Adaptation on 3D Body Skeletons via Kernel Feature Maps
本論文では、重複する行動クラスを有するデータセット間で教師ありドメイン適応を可能にするために、3次元ボディスケルトンシーケンスのカーネルベースの特徴マップ表現を提案する。時間的関節シーケンスをテクスチャに類似したカーネルマップに符号化することで、重複する行動クラスを持つデータセット間でクラスごとの分布を整列させることで、3つのベンチマークで最先端の性能を達成した。
Deep learning is ubiquitous across many areas areas of computer vision. It often requires large scale datasets for training before being fine-tuned on small-to-medium scale problems. Activity, or, in other words, action recognition, is one of many application areas of deep learning. While there exist many Convolutional Neural Network architectures that work with the RGB and optical flow frames, training on the time sequences of 3D body skeleton joints is often performed via recurrent networks such as LSTM. In this paper, we propose a new representation which encodes sequences of 3D body skeleton joints in texture-like representations derived from mathematically rigorous kernel methods. Such a representation becomes the first layer in a standard CNN network e.g., ResNet-50, which is then used in the supervised domain adaptation pipeline to transfer information from the source to target dataset. This lets us leverage the available Kinect-based data beyond training on a single dataset and outperform simple fine-tuning on any two datasets combined in a naive manner. More specifically, in this paper we utilize the overlapping classes between datasets. We associate datapoints of the same class via so-called commonality, known from the supervised domain adaptation. We demonstrate state-of-the-art results on three publicly available benchmarks.
研究の動機と目的
- 重複する行動クラスを有するデータセット間でのドメイン適応を活用することで、3次元人間行動認識におけるラベル付きデータの制限を克服すること。
- LSTMなどの再帰的ネットワーク(RNN)が3次元スケルトンシーケンスを処理する際の制限を克服し、ResNet-50のような強力な汎用CNNを活用可能にすること。
- 3次元スケルトンシーケンスを標準CNNと互換性のある形に変換する数学的に根拠のある表現を開発すること。
- 2次統計量のマトリクス整列に基づく教師ありドメイン適応フレームワークを用いて、ソースとターゲットデータセット間の知識移行を可能にすること。
- 分類損失とドメイン整列損失を同時に最適化することで、行動認識の汎化性能と性能を向上させること。
提案手法
- 数学的に厳密なカーネル法を用いて、3次元ボディ関節座標のシーケンスをカーネル特徴マップに変換し、テクスチャに類似した入力表現を生成する。
- 得られたカーネル特徴マップを事前学習済みのResNet-50ネットワークに入力とし、標準CNNと併用可能なエンドツーエンドの学習を可能にする。
- So-HoT手法に基づく教師ありドメイン適応フレームワークを実装し、ソースとターゲットドメイン間でクラス固有の特徴分布(平均と共分散)を整列させる。
- ソフトマックス交差エントロピー損失とドメイン整列損失($\hbar$)を組み合わせたジョイント損失関数を用い、ドメイン間でのクラス平均と共分散の差を最小化する。
- 類似した意思決定境界をソースおよびターゲットネットワークに促すために、近接性損失($\eta \|\mathbf{W} - \mathbf{W}^*\|_F^2$)を適用する。
- クラスごとのバッチサンプリングを採用し、ソースとターゲットのサンプルが同じクラスである場合にのみ整列損失を適用することで、学習の安定性と整列品質を向上させる。
実験結果
リサーチクエスチョン
- RQ1カーネルベースの特徴マップは、標準CNNでの利用を想定した3次元スケルトンシーケンスを効果的に表現できるか?
- RQ22次統計量に基づく教師ありドメイン適応は、重複する行動クラスを持つデータセット間での知識移行において、行動認識性能を向上させるか?
- RQ3ソースとターゲットデータセットを統合した場合、提案手法は単純な微調整と比較してどのように異なるか?
- RQ4ハイパーパrameter($\sigma_1$, $\sigma_2$, $Z_1$, $Z_2$)の値がモデル性能に与える影響は何か?
- RQ5部分的なクラスオーバーラップを有する多様なベンチマークにおいて、本手法は一般化可能か?
主な発見
- 提案されたカーネル特徴マップ表現により、ResNet-50のような事前学習済みCNNを3次元スケルトンに基づく行動認識に効果的に活用できるようになった。
- 本手法は、NTU RGB+D、UTKinect-Action3D、SBU-Kinect-Interactionの3つの公開ベンチマークで最先端の性能を達成した。
- クラスごとの平均と共分散の整列を用いた教師ありドメイン適応は、統合データセットへの単純な微調整を著しく上回る性能を発揮した。
- アブレーションスタディの結果、整列損失$\hbar$が性能に大きく寄与しており、UTKデータセットにおける最適なハイパーパrameterは$\sigma_1 = 0.6$, $\sigma_2 = 0.6$, $Z_1 = 5$, $Z_2 = 15$であった。
- 本手法を用いることで、異なるデータセット間でも高い精度を維持でき、提案されたドメイン適応戦略によりドメインシフトに対して高いロバストネスを示した。
- 本手法は、3次元スケルトンシーケンスに対して、RNNやLSTMではなくCNNを用いた教師ありドメイン適応を初めて成功裏に適用した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。