[論文レビュー] Hierarchical Consistent Contrastive Learning for Skeleton-Based Action Recognition with Growing Augmentations
本論文は、骨格ベースの行動認識のための階層的整合的対照学習フレームワークHiCLRを提案する。この手法は、段階的な増強ポリシーを用いて徐々に強い増幅を適用しつつ、非対称損失関数により階層的整合性を強制する。GCNおよびトランスフォーマーベースの両方を用いた線形、KNN、半教師あり、教師あり評価プロトコルにおいて、NTU60、NTU120、PKUMMDで顕著に最先端の性能を達成し、新たなSOTAを樹立した。
Contrastive learning has been proven beneficial for self-supervised skeleton-based action recognition. Most contrastive learning methods utilize carefully designed augmentations to generate different movement patterns of skeletons for the same semantics. However, it is still a pending issue to apply strong augmentations, which distort the images/skeletons' structures and cause semantic loss, due to their resulting unstable training. In this paper, we investigate the potential of adopting strong augmentations and propose a general hierarchical consistent contrastive learning framework (HiCLR) for skeleton-based action recognition. Specifically, we first design a gradual growing augmentation policy to generate multiple ordered positive pairs, which guide to achieve the consistency of the learned representation from different views. Then, an asymmetric loss is proposed to enforce the hierarchical consistency via a directional clustering operation in the feature space, pulling the representations from strongly augmented views closer to those from weakly augmented views for better generalizability. Meanwhile, we propose and evaluate three kinds of strong augmentations for 3D skeletons to demonstrate the effectiveness of our method. Extensive experiments show that HiCLR outperforms the state-of-the-art methods notably on three large-scale datasets, i.e., NTU60, NTU120, and PKUMMD.
研究の動機と目的
- 自己教師あり骨格ベースの行動認識における強いデータ増幅によって引き起こされる不安定性と性能低下を解消すること。
- 意味的整合性を損なうことなく、強力な増幅を体系的に活用することで表現学習を向上させること。
- 異なる増幅を非対称的に扱い、弱い視点から強い視点への階層的整合性を優先する対照学習フレームワークを設計すること。
- 提案手法の有効性を、さまざまなバックボーン(GCNとトランスフォーマー)および評価プロトコルにおいて示すこと。
- 既存手法を上回る一般化可能でスケーラブルな自己教師あり骨格表現学習フレームワークを提供すること。
提案手法
- 弱い増幅から強い増幅へ段階的に増幅を強化する、順序付きの正例ペアを生成する段階的増幅ポリシーを設計する。
- 強い増幅ビューからの特徴量を弱い増幅ビューに近づけることで、階層的整合性を強制する非対称損失関数を導入する。
- 特徴空間における方向性クラスタリングを用いて、増幅の階層構造全体にわたる一貫性のある表現学習を促進する。
- 3次元骨格における3つの新規な強力な増幅法(ランダムマスク、ジッター、ドロップコネクト)を提案・評価し、表現の多様性を向上させる。
- GCNおよびトランスフォーマーベースの両方と互換性があり、異なるアーキテクチャへの広範な適用性を実現する。
- 階層的正例ペアと非対称対照学習を統合したトレーニングパイプラインにより、学習の安定化と一般化性能の向上を図る。
実験結果
リサーチクエスチョン
- RQ1自己教師あり骨格ベースの行動認識において、強いデータ増幅を意味的ずれや学習の不安定性を引き起こさずに効果的に活用できるか?
- RQ2段階的に増幅が強化されるビュー間の階層的整合性をどのように強制することで、特徴表現の質を向上させられるか?
- RQ3強い増幅を弱いものに合わせる非対称学習が、下流の行動認識性能に与える影響は何か?
- RQ4さまざまな評価プロトコル(線形、KNN、半教師あり、教師あり)において、本手法は既存の対照学習手法と比べてどのように差をつけるか?
- RQ5GCNやトランスフォーマーなどの異なるバックボーンアーキテクチャに一般化可能であり、SOTA性能を維持できるか?
主な発見
- NTU60 xsubおよびxviewプロトコルにおいて、それぞれ88.3%および93.2%のトップ1精度を達成し、以前のSOTA手法を上回った。
- NTU120データセットでは、xsubおよびxsetプロトコルで85.6%および87.5%の精度を達成し、新たなSOTAベンチマークを樹立した。
- 学習データの1%を用いた半教師あり学習において、xsubおよびxviewで84.0%および84.8%の精度を達成し、先行手法を大きく上回った。
- モデルパラメータの1%しか使用しなくても、より大きなトランスフォーマー基盤モデルと同等またはそれ以上の性能を達成した。これは高い効率性を示している。
- KNN評価において、SkeletonCLR や AimCLR といったベースライン手法と比較して10–15%の向上を示し、より判別性の高い特徴空間であることが示された。
- 教師あり、線形、KNNのすべての評価プロトコルにおいて、一貫して最先端の手法を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。