[論文レビュー] Contrast-reconstruction Representation Learning for Self-supervised Skeleton-based Action Recognition
本論文は、座標系列と速度系列の両方の対照的再構成を組み合わせることで、スケルトンベースの行動認識のための自己教師ありフレームワークである対比的再構成表現学習(CRRL)を提案する。知識蒸留を用いて、対照的学習者が学習した運動知識を再構成オートエンコーダに転送することで、ラベルなしデータを必要とせずに複数のベンチマークで最先端の性能を達成する。
Skeleton-based action recognition is widely used in varied areas, e.g., surveillance and human-machine interaction. Existing models are mainly learned in a supervised manner, thus heavily depending on large-scale labeled data which could be infeasible when labels are prohibitively expensive. In this paper, we propose a novel Contrast-Reconstruction Representation Learning network (CRRL) that simultaneously captures postures and motion dynamics for unsupervised skeleton-based action recognition. It mainly consists of three parts: Sequence Reconstructor, Contrastive Motion Learner, and Information Fuser. The Sequence Reconstructor learns representation from skeleton coordinate sequence via reconstruction, thus the learned representation tends to focus on trivial postural coordinates and be hesitant in motion learning. To enhance the learning of motions, the Contrastive Motion Learner performs contrastive learning between the representations learned from coordinate sequence and additional velocity sequence, respectively. Finally, in the Information Fuser, we explore varied strategies to combine the Sequence Reconstructor and Contrastive Motion Learner, and propose to capture postures and motions simultaneously via a knowledge-distillation based fusion strategy that transfers the motion learning from the Contrastive Motion Learner to the Sequence Reconstructor. Experimental results on several benchmarks, i.e., NTU RGB+D 60, NTU RGB+D 120, CMU mocap, and NW-UCLA, demonstrate the promise of the proposed CRRL method by far outperforming state-of-the-art approaches.
研究の動機と目的
- 既存の自己教師ありスケルトンベースの行動認識手法が静的ポーズに過剰に注目し、運動ダイナミクスを十分に捉えていないという限界に対処すること。
- 速度系列などの明示的な運動信号を学習プロセスに組み込むことで、非教師あり表現学習を向上させること。
- 対照的運動学習者から再構成オートエンコーダへの知識蒸留を通じて、ポーズと運動を一度の表現で統合的にモデル化すること。
- 再構成学習と対照的学習を組み合わせた自己教師ありスケルトンベースの行動認識の有効性を検証すること。
提案手法
- シーケンス再構成器(SER)はエンコーダ・デコーダアーキテクチャを用い、元のスケルトン座標系列を再構成することで、空間的ポーズ表現を学習する。
- 対照的運動学習者(CML)は、座標系列と速度系列の表現の間で対照的学習を実行し、運動ダイナミクスの学習を強化する。
- 情報統合器(INF)は知識蒸留を適用し、CMLのクエリエンコーダを教師として、SERのエンコーダをガイドすることで、運動に敏感な特徴を転送する。
- 対照的学習の安定化と相互情報量の向上のため、モーメンタム更新付きキーエンコーダと更新なしのキーマルチレイヤーパーセプトロン(MLP)を用いる。
- 再構成損失と対照的損失の組み合わせにより、温度スケーリングとメモリバンクを用いて正例・負例の管理を最適化しながら、エンドツーエンドでモデルを訓練する。
- 最終的な表現は、蒸留によりポーズと運動の両方を捉えた学生エンコーダ(SER内)から得られる。
実験結果
リサーチクエスチョン
- RQ1自己教師ありスケルトンベースの行動認識に速度系列を組み込むことで、座標再構成に依存する手法と比較して、運動ダイナミクスの学習が向上するか?
- RQ2対照的運動学習者から再構成オートエンコーダへの知識蒸留は、ポーズ表現を保持しつつ、運動知識を効果的に転送できるか?
- RQ3温度パラメータや負例数といったハイパーパrameterが、CRRLの対照的学習モジュールの性能に与える影響は何か?
- RQ4提案されたCRRLフレームワークは、標準的なスケルトンベースの行動認識ベンチマークで、既存の自己教師あり手法を上回る性能を示すか?
主な発見
- クロスサブジェクトプロトコル下でNTU RGB+D 60データセットにおいて73.8%の精度を達成し、最先端の手法を上回った。
- NTU RGB+D 120データセットでは67.6%の精度を達成し、より大きな行動セットに対しても優れた一般化性能を示した。
- アブレーションスタディの結果、前向きと逆向きの両方向再構成を用いることで、片方向再構成と比較して2.5%の性能向上が確認された。
- 対照モジュールで更新なしのキーマルチレイヤーパーセプトロンを用いることで、モーメンタム更新付きキーマルチレイヤーパーセプトロンと比較して1.5%の性能向上が得られた。
- 最適な温度ハイパーパrameter τは0.1であると特定され、類似度分布のなめらかさと対照的学習の有効性のバランスが取れた。
- 速度とスケルトン再構成を同時に学習するVGSRベースラインでさえ、CRRLに劣る結果を示し、提案された蒸留ベースの統合戦略の優位性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。