Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised 3D Human Pose Representation with Viewpoint and Pose Disentanglement

Qiang Nie, Ziwei Liu|arXiv (Cornell University)|Jul 14, 2020
Human Pose and Action Recognition被引用数 10
ひとこと要約

本稿では、SeBiReNetと呼ばれる新規の逐次双方向再帰ネットワークを用いたシアンプルドノイズオートエンコーダを用いて、視点依存とポーズ依存の特徴を分離する非教師あり3次元人体ポーズ表現手法を提案する。この手法は、内在的なポーズの運動学的性質と幾何学的構造を保持し、ポーズノイズ除去および非教師あり行動認識において最先端の性能を達成するとともに、教師なしまたは手作業で設計された特徴なしに、視点不変の表現学習を可能にする。

ABSTRACT

Learning a good 3D human pose representation is important for human pose related tasks, e.g. human 3D pose estimation and action recognition. Within all these problems, preserving the intrinsic pose information and adapting to view variations are two critical issues. In this work, we propose a novel Siamese denoising autoencoder to learn a 3D pose representation by disentangling the pose-dependent and view-dependent feature from the human skeleton data, in a fully unsupervised manner. These two disentangled features are utilized together as the representation of the 3D pose. To consider both the kinematic and geometric dependencies, a sequential bidirectional recursive network (SeBiReNet) is further proposed to model the human skeleton data. Extensive experiments demonstrate that the learned representation 1) preserves the intrinsic information of human pose, 2) shows good transferability across datasets and tasks. Notably, our approach achieves state-of-the-art performance on two inherently different tasks: pose denoising and unsupervised action recognition. Code and models are available at: \url{https://github.com/NIEQiang001/unsupervised-human-pose.git}

研究の動機と目的

  • 視点の変化に対しても内在的なポーズ情報が保持される3次元人体ポーズ表現を学習すること。
  • 事前に手作業で設計された不変性を用いず、完全に非教師ありの方法でポーズ依存と視点依存の特徴を分離すること。
  • 学習可能な逐次アーキテクチャを用いて、人体骨格における運動学的および幾何的依存関係をモデル化すること。
  • 得られた表現の転移性を、ポーズノイズ除去や非教師あり行動認識といったデータセットおよびタスク間で向上させること。
  • 潜在空間における視点変換を可能にすることで、より良い分離と耐性を向上させる正則化を実現すること。

提案手法

  • 人体骨格における関節間の運動学的依存関係をモデル化するため、逐次双方向再帰ネットワーク(SeBiReNet)を提案し、前向きおよび後向きの運動伝播を捉える。
  • 共有重みを持つシアンプルドノイズオートエンコーダ(DAE)を設計し、非教師ありで汚染された骨格シーケンスから分離表現を学習する。
  • 潜在コードを2つの異なる特徴に分解する:ポーズ依存(視点不変)および視点依存(視点変動)特徴。両者を併用することで表現を強化する。
  • 視点依存特徴に単位直交行列制約を適用することで、分離を強化し、一般化性能を向上させる。
  • ランダムに回転させたポーズおよび視点変換済みポーズに対して、特徴損失および再構成損失を導入し、視点不変ポーズ特徴の学習を正則化する。
  • 3次元ポーズ推定のための2ストリームフレームワークを採用。3次元ストリームは事前学習済みであり、2次元ストリームは3次元表現に一致するように正則化される。

実験結果

リサーチクエスチョン

  • RQ1完全に非教師ありの手法が、3次元人体ポーズデータにおけるポーズ依存と視点依存の特徴を効果的に分離できるか?
  • RQ2事前に視点不変特徴を抽出するのではなく、特徴を分離することで、より多くの内在的ポーズ情報を保持できるか?
  • RQ3分離された表現は、ポーズノイズ除去や非教師あり行動認識といった、データセットおよびタスク間で一般化可能か?
  • RQ4SeBiReNetは、標準的なRNNやCNNと比較して、関節間の運動学的依存関係をどれほど効果的にモデル化できるか?
  • RQ5学習された表現は、潜在空間における視点変換を可能にし、耐性および一般化性能の向上に寄与するか?

主な発見

  • N-UCLAデータセットにおけるクロスビュー行動認識で80.30%の精度を達成し、ベースライン(51.53%)およびアブレーションバージョンを顕著に上回った。
  • NTU RGB+Dデータセットでは79.71%の精度を達成し、異なるデータセット間での強力な転移性を示した。
  • アブレーションスタディの結果、特に特徴損失および視点変換済みポーズの再構成が性能向上に段階的に寄与しており、完全なアーキテクチャが最高の精度を達成した。
  • 非教師あり行動認識およびポーズノイズ除去において、既存の非教師ありおよび弱教師ありベースラインを上回る最先端の性能を達成した。
  • H3.6Mデータセットにおける2次元ポーズからの3次元ポーズ推定では、53.1 mmのMPJPEを達成し、単純な拡張フレームワークにもかかわらず、多数の強力なベースラインを上回った。
  • モデルはたった0.27百万パラメータで構成されており、他の最先端手法と比較して極めて高い効率性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。