[論文レビュー] Contrastive Learning from Extremely Augmented Skeleton Sequences for Self-supervised Action Recognition
本稿では、極端なデータ増強と新しい情報抽出戦略を活用してより汎用性の高い表現を学習する、骨格ベースの行動認識のための自己教師付き対照学習フレームワークAimCLRを提案する。エネルギーに基づく注目誘導ドロップアウト、二重分布的乖離最小化、最近傍探索を導入することで、複数のベンチマークで最先端の性能を達成し、線形評価プロトコル下でNTU RGB+D 120において従来手法を最大4.0%上回った。
In recent years, self-supervised representation learning for skeleton-based action recognition has been developed with the advance of contrastive learning methods. The existing contrastive learning methods use normal augmentations to construct similar positive samples, which limits the ability to explore novel movement patterns. In this paper, to make better use of the movement patterns introduced by extreme augmentations, a Contrastive Learning framework utilizing Abundant Information Mining for self-supervised action Representation (AimCLR) is proposed. First, the extreme augmentations and the Energy-based Attention-guided Drop Module (EADM) are proposed to obtain diverse positive samples, which bring novel movement patterns to improve the universality of the learned representations. Second, since directly using extreme augmentations may not be able to boost the performance due to the drastic changes in original identity, the Dual Distributional Divergence Minimization Loss (D$^3$M Loss) is proposed to minimize the distribution divergence in a more gentle way. Third, the Nearest Neighbors Mining (NNM) is proposed to further expand positive samples to make the abundant information mining process more reasonable. Exhaustive experiments on NTU RGB+D 60, PKU-MMD, NTU RGB+D 120 datasets have verified that our AimCLR can significantly perform favorably against state-of-the-art methods under a variety of evaluation protocols with observed higher quality action representations. Our code is available at https://github.com/Levigty/AimCLR.
研究の動機と目的
- 既存の骨格ベース行動認識の対照学習手法における、新しい動きのパターンの探索が限定的である問題に対処すること。
- 極端なデータ増強による顕著なアイデンティティ変化が引き起こす性能低下を軽減すること。
- 標準の対照ペアを超えてポジティブサンプル集合を拡張することで、特徴学習を改善すること。
- より合理的なポジティブサンプル抽出戦略を通じて、表現品質を向上させること。
- 線形、微調整、半教師あり設定を含む多様な評価プロトコルにおいて最先端の性能を達成すること。
提案手法
- 多様でアイデンティティが歪められたビューを生成するための極端な増強を提案する。
- 増強中に情報量が少ない関節を効果的に抑制するため、エネルギーに基づく注目誘導ドロップモジュール(EADM)を導入する。
- 通常のビューと極端なビュー間の特徴分布を穏やかに一致させるために、二重分布的乖離最小化損失(D3M損失)を設計する。
- メモリバンク内の意味的に類似したサンプルを含めることで、ポジティブセットを拡張する最近傍探索(NNM)を採用する。
- 極端なビュー、EADM、D3M損失、NNMを対照学習フレームワークに統合し、豊富な情報抽出を可能にする。
- 関節、ボーン、座標ストリームを備えた二重ストリーム対照的目的関数を用いることで、特徴の多様性と一般化性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1極端なデータ増強は、自己教師付き骨格表現の一般化性能を顕著に向上させることができるか?
- RQ2極端な増強による骨格アイデンティティの著しい変化をどのように軽減すれば、性能を維持できるか?
- RQ3標準のポジティブペアを超えるより合理的なポジティブサンプル抽出戦略は、対照学習の性能向上に寄与するか?
- RQ4多様な増強ビューから得られる豊富な情報を統合することで、より良い行動表現学習が達成できるか?
- RQ5提案手法は、線形、微調整、半教師あり設定を含む複数の評価プロトコルにおいて最先端の性能を達成できるか?
主な発見
- NTU RGB+D 60では、3s-AimCLRがxsubプロトコルで54.8%、xviewプロトコルで54.3%の精度を達成し、3s-CrosSCLRをそれぞれ3.7%、4.0%上回った。
- PKU-MMDでは、3s-AimCLRがパートIで57.5%、パートIIで15.1%を記録し、3s-CrosSCLRをそれぞれ7.8%、4.9%上回った。
- ラベル付きデータがたった1%の状況でも、3s-AimCLRはPKU-MMDパートIで86.1%、NTU-60 xviewで81.6%を達成し、ISCおよび3s-CrosSCLRを大きく上回った。
- 微調整評価では、3s-AimCLRがNTU-60 xsubで86.9%、xsetで80.9%を達成し、3s-CrosSCLRをそれぞれ0.7%、0.5%上回った。
- NTU-120では、3s-AimCLRがxsubで80.1%、xsetで80.9%を記録し、以前の最先端手法ISCをそれぞれ0.5%、0.8%上回った。
- KNN評価では、AimCLRの特徴がより識別可能であることが示され、全データセットでSkeletonCLRを一貫して上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。