Skip to main content
QUICK REVIEW

[論文レビュー] Aligning Silhouette Topology for Self-Adaptive 3D Human Pose Recovery

Mugalodi Rakesh, Jogendra Nath Kundu|arXiv (Cornell University)|Apr 4, 2022
Advanced Vision and Imaging被引用数 6
ひとこと要約

本論文は、3D人体ポーズ回復のための自己教師付きドメイン適応フレームワークを提案する。この手法は、ソースで学習されたモデルを多様なラベルなしターゲットドメインに適応させるために、前景シルエットのみを用いる。畳み込みに適した空間変換を用いてシルエットからトポロジー的スケルトンを分離し、距離関数を用いたチャムファーようなトポロジー整合性損失を適用することで、低解像度、敵対的摂動、実世界設定といった困難なドメインにおいて、2D/3Dポーズやマルチビューの監視を一切用いずに最先端の性能を達成する。

ABSTRACT

Articulation-centric 2D/3D pose supervision forms the core training objective in most existing 3D human pose estimation techniques. Except for synthetic source environments, acquiring such rich supervision for each real target domain at deployment is highly inconvenient. However, we realize that standard foreground silhouette estimation techniques (on static camera feeds) remain unaffected by domain-shifts. Motivated by this, we propose a novel target adaptation framework that relies only on silhouette supervision to adapt a source-trained model-based regressor. However, in the absence of any auxiliary cue (multi-view, depth, or 2D pose), an isolated silhouette loss fails to provide a reliable pose-specific gradient and requires to be employed in tandem with a topology-centric loss. To this end, we develop a series of convolution-friendly spatial transformations in order to disentangle a topological-skeleton representation from the raw silhouette. Such a design paves the way to devise a Chamfer-inspired spatial topological-alignment loss via distance field computation, while effectively avoiding any gradient hindering spatial-to-pointset mapping. Experimental results demonstrate our superiority against prior-arts in self-adapting a source trained model to diverse unlabeled target domains, such as a) in-the-wild datasets, b) low-resolution image domains, and c) adversarially perturbed image domains (via UAP).

研究の動機と目的

  • トレーニングデータにおけるドメインバイアスによって生じるドメインシフトに起因する3D人体ポーズ推定の一般化性能の低さという課題に対処すること。
  • 2D/3Dポーズの強力な監視(例:2D/3Dポーズ)が利用できない、未知のラベルなしターゲット環境への3Dポーズモデルのデプロイを可能にすること。
  • 照明、解像度、敵対的摂動などのドメインシフトに影響されない、前景シルエット推定のロバスト性を、唯一の監視信号として活用すること。
  • ピクセルレベルの損失に起因する限界を克服するため、シルエットから強力でポーズに特化した監視を提供するトポロジー中心の損失を開発すること。
  • ターゲットドメインで2D/3Dポーズアノテーション、深度、マルチビュー画像を一切必要とせず、最先端の適応性能を達成すること。

提案手法

  • 生のバイナリシルエットからトポロジー的スケルトン表現を抽出するための、畳み込みに適した一連の空間変換を設計する。
  • 最適化中の勾配伝搬を可能にするために、微分可能な空間操作を用いてシルエットから距離関数を構築する。
  • 距離関数の最小化を通じて予測されたトポロジー的スケルトンと真値との対応を測定する、チャムファーベースの空間的トポロジー整合性損失を提案する。
  • 空間から点集合へのマッピングを排除することで勾配劣化を回避し、トポロジー表現を通じた安定なバックプロパゲーションを確保する。
  • 標準的なメッシュフィッティング目的関数とトポロジー整合性損失を統合し、自己適応中に形状とポーズを同時に最適化する。
  • 推論時における適応を可能にするために、ターゲットドメインからのシルエットのみを用いてエンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1自己教師付き適応フレームワークは、多様でラベルなしのターゲットドメインにおいて、シルエットのみの監視で強力な3D人体ポーズ回復性能を達成できるか?
  • RQ2ピクセルレベルの損失が失敗する状況において、バイナリシルエットから効果的にトポロジー構造を抽出し、ポーズに特化した監視を提供できるか?
  • RQ32D/3Dポーズ監視が欠如する状況で、微分可能で距離関数に基づくトポロジー整合性損失が、標準的なピクセルレベル損失や形状中心の損失を上回る性能を発揮できるか?
  • RQ4低解像度、敵対的摂動、実世界条件といったドメインシフトによって引き起こされる性能低下を、シルエットベースの適応がどの程度軽減できるか?
  • RQ5補助監視(例:OpenPoseによる2Dポーズ)がドメインシフトの影響で失敗する状況でも、提案されたトポロジーに配慮した損失がロバストな適応を可能にするか?

主な発見

  • 提案手法は、実世界設定の3DPWデータセットおよび低解像度のLR-3DPWドメインで最先端の性能を達成し、2Dポーズ監視を用いるベースラインを上回った。
  • 敵対的摂動を加えたUAP-H3Mドメインでは、ドメインシフトの影響で失敗するOpenPoseによる2Dポーズ推定を用いるベースラインと比べ、顕著に優れた性能を示した。
  • ターゲットのシルエットが低解像度であっても、フレームワークは効果的な適応を可能にし、画像品質の低下に対してもロバストであることを示した。
  • 定性的な結果から、モデルがシルエットのみで3Dメッシュをフィットさせられることを確認し、熱画像やNIR画像などの未学習ドメインでも高速な推論時適応が可能であることを示した。
  • アブレーションスタディにより、トポロジーに配慮した損失が不可欠であることが確認された。ピクセルレベルの損失のみでは、ポーズ回復に信頼できる勾配が得られなかった。
  • 2Dポーズ検出器が失敗する状況でも、アーティキュレーションのドメインシフトの影響を効果的に軽減できた。これは、分布シフトにおいてキーポイントベースの監視よりもトポロジー監視の優位性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。