[論文レビュー] Contrastive Learning from Spatio-Temporal Mixed Skeleton Sequences for Self-Supervised Skeleton-Based Action Recognition
本論文は、骨格ベースの行動認識のための自己教師付き対照学習フレームワークであるSkeleMixCLRを提案する。本手法は、硬い対照ペアを生成するために、新たな空間的・時間的骨格混合増幅法(SkeleMix)を導入している。トポロジー構造と空間的・時間的マスクプーリングを用いて、切り取られた骨格断片(トリムドビュー)と残りのシーケンス(トリuncatedビュー)を組み合わせることで、動きの表現学習を強化し、NTU-RGB+D、NTU120-RGB+D、PKU-MMDデータセットで最先端の性能を達成した。
Self-supervised skeleton-based action recognition with contrastive learning has attracted much attention. Recent literature shows that data augmentation and large sets of contrastive pairs are crucial in learning such representations. In this paper, we found that directly extending contrastive pairs based on normal augmentations brings limited returns in terms of performance, because the contribution of contrastive pairs from the normal data augmentation to the loss get smaller as training progresses. Therefore, we delve into hard contrastive pairs for contrastive learning. Motivated by the success of mixing augmentation strategy which improves the performance of many tasks by synthesizing novel samples, we propose SkeleMixCLR: a contrastive learning framework with a spatio-temporal skeleton mixing augmentation (SkeleMix) to complement current contrastive learning approaches by providing hard contrastive samples. First, SkeleMix utilizes the topological information of skeleton data to mix two skeleton sequences by randomly combing the cropped skeleton fragments (the trimmed view) with the remaining skeleton sequences (the truncated view). Second, a spatio-temporal mask pooling is applied to separate these two views at the feature level. Third, we extend contrastive pairs with these two views. SkeleMixCLR leverages the trimmed and truncated views to provide abundant hard contrastive pairs since they involve some context information from each other due to the graph convolution operations, which allows the model to learn better motion representations for action recognition. Extensive experiments on NTU-RGB+D, NTU120-RGB+D, and PKU-MMD datasets show that SkeleMixCLR achieves state-of-the-art performance. Codes are available at https://github.com/czhaneva/SkeleMixCLR.
研究の動機と目的
- 自己教師付き骨格ベースの行動認識における、標準的なデータ増幅から得られる対照ペアの寄与度の低下を是正すること。
- 新しいデータ増幅により、より情報量が多く、硬い対照サンプルを生成することで表現学習を向上させること。
- 骨格シーケンスにおけるトポロジー構造と空間的・時間的コンテキストを活用し、より良い動き表現学習を実現すること。
- 大規模なラベル付きデータに依存せずに、自己教師付き骨格ベースの行動認識で最先端の性能を達成すること。
提案手法
- SkeleMixは、骨格関節をトポロジー構造に基づいて5つの身体部位に分割し、そのうちの一部をランダムに選択して空間的・時間的クロッピングを実行する。
- 切り取られた断片(トリムドビュー)を、残りの骨格シーケンス(トリuncatedビュー)とランダムに組み合わせることで、混合骨格シーケンスを生成する。
- 空間的・時間的マスクプーリング(STMP)操作により、特徴レベルでトリムドビューとトリuncatedビューを分離し、両者のコンテキストを保持する。
- グラフ畳み込み演算によるクロスビューコンテキストのおかげで、トリムドビューとトリuncatedビューの間で対照学習が行われ、硬いポジティブペアが形成される。
- 性能をさらに向上させるために、複数のSkeleMix増幅を組み合わせた拡張版(SkeleMixCLR+)をフレームワークに統合する。
- 関節、動き、ボーンのスティームを用いて、NTU-60、NTU-120、PKU-MMDで評価し、下流の行動認識タスクで微調整を実施する。
実験結果
リサーチクエスチョン
- RQ1新しい混合増幅戦略により、硬い対照ペアを導入することで、自己教師付き骨格ベースの行動認識が向上するか?
- RQ2切り取られた骨格断片と残りのシーケンスを組み合わせるSkeleMixは、標準的な増幅法と比較して表現学習にどのような影響を及ぼすか?
- RQ3空間的・時間的マスクプーリング操作が、対照学習におけるクロスビューコンテキストをどの程度保持するか?
- RQ4提案手法は、異なるデータセットやデータ分割(例:クロスサブジェクト、クロスビュー)に一般化可能か?
- RQ5SkeleMixCLRは、最小限または完全にラベル付きデータが利用できない自己教師付き設定でも最先端の性能を達成できるか?
主な発見
- NTU-60 Xsubベンチマークでは、SkeleMixCLR+が87.7%の正確度を達成し、教師ありの3s-ST-GCN(85.2%)および先行の自己教師付き手法を上回った。
- NTU-60 Xviewでは、SkeleMixCLR+が82.9%の正確度を達成し、前回の最先端手法(3s-AimCLR、80.9%)を上回った。
- 1%のラベル付きデータでの半教師付き学習において、SkeleMixCLR+はPKU-MMDで62.6%、NTU-60 Xsubで55.9%を達成し、すべてのベースラインを上回った。
- 10%のラベル付きデータを用いた場合、SkeleMixCLR+はPKU-MMDで88.6%、NTU-60 Xsubで84.7%を達成し、低スケールのラベル付きデータでも強力な一般化性能を示した。
- t-SNE可視化では、SkeleMixCLR+が関節、動き、ボーンスティームのすべてで、SkeletonCLRよりもよりコンパクトで分離性の高い特徴クラスタを生成しており、NMIスコアも向上していた。
- アブレーションスタディの結果、複数のSkeleMix増幅(SkeleMixCLR+)が性能をさらに向上させることを確認し、多様な硬い対照ペアの有効性が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。