Skip to main content
QUICK REVIEW

[論文レビュー] ViA: View-invariant Skeleton Action Representation Learning via Motion Retargeting

Di Yang, Yaohui Wang|arXiv (Cornell University)|Aug 31, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

ViAは、動きのリターゲティングを事前学習タスクとして用いることで、視点および被験者に依存しないスケルトン行動表現を自己教師付きで学習するフレームワークを提案する。潜在的動き分離モジュールを用いて動きと個体特徴を分離することで、実世界の2次元およびラボ環境の3次元データセットにおける視点間・被験者間行動認識タスクで最先端の転移性能を達成する。

ABSTRACT

Current self-supervised approaches for skeleton action representation learning often focus on constrained scenarios, where videos and skeleton data are recorded in laboratory settings. When dealing with estimated skeleton data in real-world videos, such methods perform poorly due to the large variations across subjects and camera viewpoints. To address this issue, we introduce ViA, a novel View-Invariant Autoencoder for self-supervised skeleton action representation learning. ViA leverages motion retargeting between different human performers as a pretext task, in order to disentangle the latent action-specific `Motion' features on top of the visual representation of a 2D or 3D skeleton sequence. Such `Motion' features are invariant to skeleton geometry and camera view and allow ViA to facilitate both, cross-subject and cross-view action classification tasks. We conduct a study focusing on transfer-learning for skeleton-based action recognition with self-supervised pre-training on real-world data (e.g., Posetics). Our results showcase that skeleton representations learned from ViA are generic enough to improve upon state-of-the-art action classification accuracy, not only on 3D laboratory datasets such as NTU-RGB+D 60 and NTU-RGB+D 120, but also on real-world datasets where only 2D data are accurately estimated, e.g., Toyota Smarthome, UAV-Human and Penn Action.

研究の動機と目的

  • 多様な被験者および視点を持つ実世界の動画への既存の自己教師付きスケルトン行動表現手法の一般化性能の低さを解決すること。
  • 3次元スケルトンデータが入手不可能またはノイズが多い状況でも、2次元推定スケルトンから不変表現を学習することで、行動認識のロバスト性を向上させること。
  • 実世界データにおける自己教師付き事前学習のみを用いて、被験者間および視点間の行動分類に効果的な転移学習を可能にすること。
  • スケルトンシーケンスにおいて、動き固有の特徴を被験者および視点固有の特徴から分離することで不変性を達成すること。
  • 動きのリターゲティングが、汎用的かつ転送可能なスケルトン表現を学習するための有効な事前学習タスクであることを実証すること。

提案手法

  • ソースおよびドライビングスケルトンシーケンス間の動きリターゲティングを事前学習タスクとして用い、視点および被験者に依存しないオートエノードを訓練する。
  • 直交分解を用いて視覚的表現を「動き」(行動固有)および「個体」(視点/体格固有)の成分に分解する潜在的動き分離(LMD)モジュールを採用する。
  • 「動き」特徴をソースおよびドライビングシーケンス間で交換することで、軽量なスケルトンシーケンスデコーダーを用いてシーケンスを再構築する。
  • 視点不変性および行動識別を強化するために、対照的損失、サイクル再構築損失、トライオレット損失、速度損失の組み合わせを最適化に用いる。
  • 下流タスクでの微調整の前に、大規模な実世界データセットPoseticsで視覚エンコーダーを事前学習し、汎用的表現を学習する。
  • 未学習の2次元実世界および3次元ラボ環境データセットにおける転送性を評価するために、線形評価および微調整プロトコルを適用する。

実験結果

リサーチクエスチョン

  • RQ1動きのリターゲティングは、実世界の2次元データにおける視点および被験者に依存しないスケルトン表現を学習するための有効な自己教師付き事前学習タスクとして機能するか?
  • RQ2分離された「動き」特徴は、行動認識において、異なる被験者およびカメラの視点にわたってどの程度一般化可能か?
  • RQ3実世界データ(例:Posetics)における自己教師付き事前学習は、合成データにおける事前学習と比較して、転送性能をどの程度向上させるか?
  • RQ4各損失成分(自己再構築、サイクル、トライオレット、速度)が最終的な表現品質および下流タスクの正確性に果たす寄与度はどの程度か?
  • RQ5再トレーニングなしで、学習された表現は2次元実世界データセットおよび3次元ラボ環境データセットの両方で一般化可能か?

主な発見

  • ViAは、実世界(Toyota Smarthome、UAV-Human、Penn Action)およびラボ環境(NTU-RGB+D 60/120)の両方のデータセットにおいて、視点間および被験者間の行動認識タスクで最先端の性能を達成し、先行する自己教師付き手法を上回る。
  • 微調整を適用したToyota Smarthomeデータセットでは、ViAはトップ1正解率65.4%を達成し、ベースライン(61.7%)および先行手法を大きく上回る。
  • アブレーションスタディの結果、ベースラインにサイクル損失(+1.1%)およびトライオレット損失(+2.1%)を追加することで、性能向上が著しく顕著であり、視点不変性の強化に寄与していることが示された。
  • 速度損失の追加により、わずかではあるが一貫した向上(0.4%の正解率上昇)が得られ、動き表現の時間的整合性が向上していることが示唆された。
  • 定性的な結果から、効果的な分離が確認された:「動き」特徴は入力の視点に関係なく、標準化された視点不変の動きを表しており、一方「個体」特徴は体格および視点を制御している。
  • Mixamoにおけるt-SNE可視化から、「動き」特徴は被験者や視点に関係なく行動タイプごとにクラスタリングされていることが確認され、学習された表現の分離および不変性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。