[論文レビュー] Prototypical Contrast and Reverse Prediction: Unsupervised Skeleton Based Action Recognition
本稿では、アクションプロトタイプを介した高レベルの意味的類似性と、逆順序予測による低レベルの運動パターンを統合的に学習する、未学習の骨格ベース行動認識のための新規フレームワークである、プロトタイプ的対比と逆予測(PCRP)を提案する。学習プロセスを期待最大化(EM)アルゴリズムとして定式化することで、N-UCLA、NTU60、NTU120で最先端の性能を達成し、いくつかの教師あり手法を上回った。
In this paper, we focus on unsupervised representation learning for skeleton-based action recognition. Existing approaches usually learn action representations by sequential prediction but they suffer from the inability to fully learn semantic information. To address this limitation, we propose a novel framework named Prototypical Contrast and Reverse Prediction (PCRP), which not only creates reverse sequential prediction to learn low-level information (e.g., body posture at every frame) and high-level pattern (e.g., motion order), but also devises action prototypes to implicitly encode semantic similarity shared among sequences. In general, we regard action prototypes as latent variables and formulate PCRP as an expectation-maximization task. Specifically, PCRP iteratively runs (1) E-step as determining the distribution of prototypes by clustering action encoding from the encoder, and (2) M-step as optimizing the encoder by minimizing the proposed ProtoMAE loss, which helps simultaneously pull the action encoding closer to its assigned prototype and perform reverse prediction task. Extensive experiments on N-UCLA, NTU 60, and NTU 120 dataset present that PCRP outperforms state-of-the-art unsupervised methods and even achieves superior performance over some of supervised methods. Codes are available at https://github.com/Mikexu007/PCRP.
研究の動機と目的
- 既存の未学習手法が行動シーケンス間の高レベルの意味的類似性を捉えることの制限を解消すること。
- 教師なしで、低レベルの運動パターンと高レベルの意味的構造を同時にモデリングすることによって表現学習を向上させること。
- 学習可能なアクションプロトタイプを通じて、意味的類似性を暗黙的に符号化するフレームワークを開発すること。
- 標準の骨格ベース行動認識ベンチマークにおいて、既存の未学習手法を上回り、一部の教師ありベースラインをも凌駆すること。
提案手法
- フレームワークは、表現学習を期待最大化(EM)プロセスとして定式化し、Eステップではエンコーダ出力に対してk-meansクラスタリングを実行して、アクション符号化をプロトタイプに割り当てる。
- Mステップでは、対照的学習とマスク自己符号化を組み合わせた新規損失関数であるProtoMAEを最小化することでエンコーダを最適化する。
- ProtoMAEは、アクション符号化をその割り当てられたプロトタイプに引き寄せる一方で、運動の順序を捉えるために逆順序予測を強制する。
- アクションプロトタイプは潜在変数として扱われ、各プロトタイプの周囲に正規分布を仮定し、観測データの尤度を最大化するようにエンコーダを繰り返し更新する。
- 本手法は、Uni-GRUエンコーダと別個のデコーダを用い、逆順序予測を実行するが、学習中はバックプロパゲーションをエンコーダにのみ適用する。
- フレームワークは、繰り返しクラスタリングと損失最小化を交互に実行するEMの代替的アプローチで、エンドツーエンドに訓練される。
実験結果
リサーチクエスチョン
- RQ1プロトタイプ的対比は、行動シーケンス間の意味的類似性をモデリングすることで、未学習の骨格ベース行動認識を向上させることができるか?
- RQ2ラベルなしの状況下で、逆順序予測は低レベルの運動パターンおよび時間的順序の学習を向上させることができるか?
- RQ3プロトタイプの割り当てとシーケンス再構築の共同最適化は、インスタンスレベルの予測や対照的学習単体よりも優れた一般化性能を達成できるか?
- RQ4クラスタ数や複数回のクラスタリング実行回数(M値)の変更が、最終的な表現品質に与える影響は何か?
- RQ5未学習手法が、標準のベンチマークにおいて教師あり手法と同等またはそれ以上の性能を達成できるか?
主な発見
- N-UCLAデータセットでは、PCRPが線形評価で86.3%の正確度を達成し、ベースラインを3.7ポイント、HBRNNを6.5ポイント上回った。
- NTU60では、C-View設定で63.5%の正確度を達成し、ベースラインを9.6ポイント上回り、一部の設定ではDeep RNNをも上回った。
- NTU120では、C-Set設定で53.9%の正確度を達成し、同じ評価プロトコル下でPart-Aware LSTMを18.8ポイント、Soft RNNを3.1ポイント上回った。
- アブレーションスタディの結果、プロトタイプ的対比と逆予測の両方が顕著に寄与しており、併用することで最高の性能が得られた。
- 最適なクラスタ数とM値(クラスタリング実行回数)はデータセットによって異なり、N-UCLAではM=1および70クラスタが最良の結果をもたらした。
- モデルは安定して収束し、事前学習の全期間にわたり高い正確度を維持しており、強固で一貫性のある表現学習が実現していることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。