Skip to main content
QUICK REVIEW

[論文レビュー] Non-Local Latent Relation Distillation for Self-Adaptive 3D Human Pose Estimation

Jogendra Nath Kundu, Siddharth Seth|arXiv (Cornell University)|Apr 4, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、ラベルなしの画像と3次元ポーズシーケンスの間の非局所的潜在的関係を蒸留することで、ペア化された教師信号なしにドメイン適応を可能にする自己教師型3次元人体ポーズ推定フレームワークを提案する。事前学習済みの生成的敵対的オートエンコーダを用いてポーズの妥当性を保ち、ポーズ空間およびモーション空間における高次元で非局所的な関係を導入することで、3DPW や 3DHP といった標準ベンチマークで最先端の性能を達成し、未知の転送設定下でMPJPEを86.2 mmまで低減した。

ABSTRACT

Available 3D human pose estimation approaches leverage different forms of strong (2D/3D pose) or weak (multi-view or depth) paired supervision. Barring synthetic or in-studio domains, acquiring such supervision for each new target environment is highly inconvenient. To this end, we cast 3D pose learning as a self-supervised adaptation problem that aims to transfer the task knowledge from a labeled source domain to a completely unpaired target. We propose to infer image-to-pose via two explicit mappings viz. image-to-latent and latent-to-pose where the latter is a pre-learned decoder obtained from a prior-enforcing generative adversarial auto-encoder. Next, we introduce relation distillation as a means to align the unpaired cross-modal samples i.e. the unpaired target videos and unpaired 3D pose sequences. To this end, we propose a new set of non-local relations in order to characterize long-range latent pose interactions unlike general contrastive relations where positive couplings are limited to a local neighborhood structure. Further, we provide an objective way to quantify non-localness in order to select the most effective relation set. We evaluate different self-adaptation settings and demonstrate state-of-the-art 3D human pose estimation performance on standard benchmarks.

研究の動機と目的

  • ラベル付きソースドメインからラベルなしターゲットドメインへの自己教師型適応を可能にすることで、3次元人体ポーズ推定におけるドメインシフトの課題に対処すること。
  • 実世界の環境(例:屋外での撮影)では費用がかかり、現実的でないペア化された教師信号の限界を克服すること。
  • 潜在空間における構造的でインスタンスに根ざした関係的知識を用いて、未対応の画像と3次元ポーズデータを整合させること。
  • ポーズおよびモーションシーケンスにおける長距離で非局所的な相互作用をモデル化することで、表現学習におけるインスタンスレベルの不整合を低減すること。
  • マルチビュー、深度、2次元キーポイントの教師信号に依存せずに、標準ベンチマークで最先端の性能を達成すること。

提案手法

  • フレームワークは2つの明示的なマッピングを用いる:画像→潜在空間のCNNと、事前制約付きGANベースのオートエンコーダ(AAE)から得た事前学習済みの潜在空間→ポーズデコーダ。
  • 再帰的なAAEを用いて、未対応の3次元ポーズシーケンス上でモーション埋め込みを事前学習し、時間的整合性と妥当性を確保する。
  • 局所的近傍を越えたポーズ空間およびモーション空間における長距離相互作用をモデル化するため、非局所的関係(例:'ポーズ反転'や'逆方向反転')を導入する。
  • 関係的エネルギー関数を、関係的相手(例:反転または逆順のシーケンス)の潜在埋め込みを回帰する固定ニューラルネットワークを介して学習する。
  • 画像→潜在空間ネットワークを、これらの関係的エネルギーの蒸留により適応させ、画像とポーズの潜在多様体間の乖離を最小化する。
  • 段階的な訓練スケジュールを採用し、複数の関係的損失($\mathcal{L}_{LCR}$, $\mathcal{L}_{HCR}$, $\mathcal{L}_{3}^{z}$, $\mathcal{L}_{2}^{v}$, および $\mathcal{L}_{3}^{v}$)を順次適用することで、整合性を段階的に向上させる。

実験結果

リサーチクエスチョン

  • RQ1潜在ポーズおよびモーション空間における非局所的かつ高次元の関係が、ペア化された教師信号なしに未対応の画像と3次元ポーズデータを効果的に整合させることができるか?
  • RQ2長距離相互作用をモデル化することで、自己教師型3次元ポーズ推定における表現の整合性が向上し、インスタンスレベルの不整合が低減するか?
  • RQ3提案フレームワークは、屋外およびスタジオ環境を含む多様なドメインにどの程度一般化可能か?
  • RQ4事前学習済みの生成的デコーダが妥当性を保ちつつ、ラベルなしターゲットドメインへの効果的適応を可能にするか?
  • RQ5異なる関係的損失は最終的な性能にどのように寄与するか?また、最良の一般化を達成する損失の組み合わせは何か?

主な発見

  • 提案手法 Ours(SH → W) は、未知の転送設定下で3DPWベンチマークにおいて86.2 mmという最先端のMPJPEを達成した。
  • 非局所的ポーズおよびモーション関係の蒸留($\mathcal{L}_{3}^{z}$ および $\mathcal{L}_{3}^{v}$)を追加することで、ソースのみの設定(209.6 mm)からMPJPEが86.2 mmにまで低下し、顕著な改善が確認された。
  • アブレーションスタディにより、高次元の非局所的モーション関係の蒸留($\mathcal{L}_{2}^{v}$ および $\mathcal{L}_{3}^{v}$)がインスタンスレベルの不整合低減に不可欠であることが確認された。
  • スタジオ環境のHuman3.6Mデータ(SH → W)を追加のラベル付きソースとして用いることで、ドメインギャップが顕著に低減し、屋外データへの一般化性能が向上した。
  • 定性的な結果から、多様なポーズ、衣装、背景に対しても堅牢な一般化が実現していることが示された。失敗は主に重度の隠蔽やレアなアスリートポーズの場面で発生した。
  • ペア化された教師信号がなくても、事前制約付きの生成的デコーダのおかげで妥当な3次元ポーズ出力を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。