Skip to main content
QUICK REVIEW

[論文レビュー] Actionlet-Dependent Contrastive Learning for Unsupervised Skeleton-Based Action Recognition

Lilang Lin, Jiahang Zhang|arXiv (Cornell University)|Mar 20, 2023
Human Pose and Action Recognition被引用数 5
ひとこと要約

本稿では、自己教師あり対照学習手法ActCLRを提案する。この手法は、動きを表す特徴的で局所的な骨格部分(アクションレット)を無教師で抽出することで、動き領域と静的領域を適応的にモデル化する。各シーケンスを全訓練シーケンスの平均動きアンカーと比較することでアクションレットを特定し、それらを基に動きに適応したデータ拡張と意味論に配慮した特徴プーリングを適用することで、NTU RGB+DおよびPKUMMDで自己教師あり学習のみで最先端の性能を達成した。

ABSTRACT

The self-supervised pretraining paradigm has achieved great success in skeleton-based action recognition. However, these methods treat the motion and static parts equally, and lack an adaptive design for different parts, which has a negative impact on the accuracy of action recognition. To realize the adaptive action modeling of both parts, we propose an Actionlet-Dependent Contrastive Learning method (ActCLR). The actionlet, defined as the discriminative subset of the human skeleton, effectively decomposes motion regions for better action modeling. In detail, by contrasting with the static anchor without motion, we extract the motion region of the skeleton data, which serves as the actionlet, in an unsupervised manner. Then, centering on actionlet, a motion-adaptive data transformation method is built. Different data transformations are applied to actionlet and non-actionlet regions to introduce more diversity while maintaining their own characteristics. Meanwhile, we propose a semantic-aware feature pooling method to build feature representations among motion and static regions in a distinguished manner. Extensive experiments on NTU RGB+D and PKUMMD show that the proposed method achieves remarkable action recognition performance. More visualization and quantitative experiments demonstrate the effectiveness of our method. Our project website is available at https://langlandslin.github.io/projects/ActCLR/

研究の動機と目的

  • 既存の自己教師あり骨格手法が動き領域と静的領域を均一に扱うという限界を解消し、動きに敏感な関節への過剰な拡張が性能を低下させることを防ぐ。
  • 全シーケンスの平均動きアンカーと比較することで、行動を表す特徴的で局所的な骨格部分(アクションレット)をラベルなしで発見する。
  • 非アクションレット領域にのみ強い拡張を適用する動きに適応したデータ変換戦略を設計し、動きの意味論を保持する。
  • アクションレット領域に注目し、静的関節からの干渉を最小限に抑える意味論に配慮した特徴プーリング機構を構築する。
  • 動き領域と静的領域を分離することで、自己教師あり行動認識における汎化性と頑健性が向上することを示す。

提案手法

  • 各骨格シーケンスを全訓練シーケンスの平均動きと比較することで、動きが顕著な領域を最大偏差を持つものとして無教師でアクションレットを抽出する。
  • 平均動きシーケンスが静的アンカーとして機能し、行動ラベルを一切必要とせず、アクションレットの無教師特定を可能にする。
  • 動きに適応したデータ拡張戦略により、非アクションレット領域にのみ強い変換(例:ノイズ、マスキング)を適用し、動き領域の意味論的整合性を保つ。
  • 意味論に配慮した特徴プーリングは、アクションレット領域と非アクションレット領域を別々に特徴抽出・集約することで、動き表現を強化する。
  • 対照学習の目的関数は、同一シーケンスを異なる拡張で得たポジティブペアに基づき最適化され、アクションレットに従う戦略が特徴の識別性を向上させる。
  • 類似度マイニング損失により特徴空間が正則化され、行動クラスのクラスタリングが促進される。

実験結果

リサーチクエスチョン

  • RQ1骨格シーケンスから無教師でアクションレットを抽出することで、自己教師あり対照学習の性能が向上するか?
  • RQ2非アクションレット領域にのみ適用する動きに適応したデータ拡張戦略は、より優れた特徴学習と頑健性をもたらすか?
  • RQ3アクションレット領域に注目する意味論に配慮した特徴プーリングは、グローバルプーリングと比較してモデル性能を向上させるか?
  • RQ4動き領域と静的領域を分離することで、自己教師あり骨格ベースの行動認識における汎化性と精度にどのような影響を与えるか?
  • RQ5本手法は、全関節に均一な拡張を適用する手法と比較して、データ拡張ノイズに対してより頑健であるか?

主な発見

  • NTU RGB+D 60 x-viewsベンチマークでは、ActCLRは自己教師あり事前学習のみで78.04%のKNN精度と86.79%の線形プローブ精度を達成した。
  • PKUMMDでは、ActCLRは74.31%のKNN精度と83.52%の線形プローブ精度を達成し、最先端の自己教師あり手法を上回った。
  • 動きに適応した変換戦略により、ノイズ下での性能劣化が軽減された:ノイズ強度0.1の条件下で、非アクションレット領域では精度低下が1.33%にとどまり、全領域拡張と比較して2.32%の低下より顕著に改善された。
  • 意味論に配慮した特徴プーリングは、オフラインで使用した際、KNN精度を1.66%向上させ、動き表現の強化効果を実証した。
  • アブレーションスタディの結果、アクションレット領域のみで76.38%のKNN精度を達成し、全骨格特徴と同等の性能を示した。一方、非アクションレット領域では67.50%の精度にとどまり、アクションレットが主な動き信号を捉えていることを裏付けた。
  • 可視化結果から、アクションレットが動きが顕著な関節(例:『投げる』動作における手)に局在していることが確認され、その判別性と時空間的性質が妥当であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。