Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Human Action Recognition with Skeletal Graph Laplacian and Self-Supervised Viewpoints Invariance

G Paoletti, Jacopo Cavazza|arXiv (Cornell University)|Apr 21, 2022
Human Pose and Action Recognition被引用数 10
ひとこと要約

本稿では、視点不変な骨格表現を学習するために、グラフラプラシアン正則化付き畳み込み自己符号化器を用いた教師なし人体行動認識手法を提案する。自己教師付き勾配反転層を統合し、再構築空間におけるラプラシアン正則化を活用することで、NTU-60およびNTU-120データセットで最先端の性能を達成し、従来の教師なし手法を上回り、一部の教師あり手法と同等の性能を示した。

ABSTRACT

This paper presents a novel end-to-end method for the problem of skeleton-based unsupervised human action recognition. We propose a new architecture with a convolutional autoencoder that uses graph Laplacian regularization to model the skeletal geometry across the temporal dynamics of actions. Our approach is robust towards viewpoint variations by including a self-supervised gradient reverse layer that ensures generalization across camera views. The proposed method is validated on NTU-60 and NTU-120 large-scale datasets in which it outperforms all prior unsupervised skeleton-based approaches on the cross-subject, cross-view, and cross-setup protocols. Although unsupervised, our learnable representation allows our method even to surpass a few supervised skeleton-based action recognition methods. The code is available in: www.github.com/IIT-PAVIS/UHAR_Skeletal_Laplacian

研究の動機と目的

  • 教師あり人体行動認識の高コストと限界を解消するため、ラベルなし3次元骨格シーケンスから意味のある表現を学習する教師なし手法の開発。
  • 実世界の展開における視点変化へのロバスト性を向上させるため、敵対的学習による自己教師付き視点不変性を導入。
  • 骨格トポロジーに沿ったグラフラプラシアン正則化を用いて構造的幾何的事前知識を特徴学習に統合。
  • 幾何的制約と不変性制約を備えた教師なし事前学習が、教師あり手法と競合可能な表現を生成できることを実証。

提案手法

  • 残差畳み込み自己符号化器を用い、3次元骨格シーケンスから教師なしで空間時間的表現を学習。
  • 再構築空間にグラフラプラシアン正則化を適用し、骨格幾何を保存するとともに、潜在表現の滑らかさを強制。
  • 入力骨格に適用されたランダム回転摂動を敵対的に再構築するため、自己教師付き勾配反転層を導入し、視点不変特徴を学習。
  • 特にクロスビューおよびクロスセットプロトコルにおいて一般化性能を向上させるために、ランダム回転を用いて合成データを生成。
  • 再構築損失と自己教師付きレグレッサー損失を用い、勾配反転によりラベルなし視点データを必要とせずに不変性を実現、エンドツーエンドでモデルを訓練。
  • NTU-60およびNTU-120データセットにおいて、クロスサブジェクト、クロスビュー、クロスセット設定下で1-NNおよび線形評価プロトコルを用いて性能を評価。

実験結果

リサーチクエスチョン

  • RQ1骨格幾何を符号化することで、グラフラプラシアン正則化が教師なし特徴学習を向上させるか?
  • RQ2勾配反転による自己教師付き視点不変性は、従来の教師なし手法と比較して、カメラビュー間での一般化性能を向上させるか?
  • RQ3幾何的制約と不変性制約を備えた教師なし自己符号化器は、大規模HARベンチマークで教師あり手法と同等の性能を達成できるか?
  • RQ4回転摂動を加えた合成データの使用は、クロスビューおよびクロスセット評価プロトコルにおけるモデル一般化にどのように影響するか?

主な発見

  • 提案手法GRAE-Lは、合成データのみを用いてNTU-60 C-Viewで82.4%、NTU-120 C-Setupで48.9%の精度を達成し、すべての先行教師なし骨格ベース手法を上回った。
  • NTU-60 C-Subjectでは、クロスビュープロトコルで81.0%、クロスサブジェクトプロトコルで52.3%の精度を達成し、以前のSOTA教師なしアプローチを上回った。
  • ラベルなしデータのみを用いても、特にクロスビューおよびクロスセット設定で、複数の教師あり骨格ベースHAR手法を上回る性能を示した。
  • アブレーションスタディの結果、自己教師付き視点不変性(SSVI)を備えたモデルは、ベースライン自己符号化器およびAE-Lを一貫して上回り、実データが不足している場合や前処理が行われない状況でも顕著な優位性を示した。
  • 線形分類器を用いた教師なしエンコーダーのファインチューニングにより、NTU-60 C-Viewで83.8%、NTU-120 C-Setupで61.1%の精度を達成し、学習済み特徴の強力な転送性を示した。
  • 合成データのみで学習した場合、実データで学習した場合に比べ性能が低下するが、SSVIベースのモデルは非SSVI対応モデルを常に上回り、自己教師付き不変性機構の有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。