Skip to main content
QUICK REVIEW

[論文レビュー] Conditional Directed Graph Convolution for 3D Human Pose Estimation

Wenbo Hu, Changgong Zhang|arXiv (Cornell University)|Jul 16, 2021
Human Pose and Action Recognition参考文献 57被引用数 6
ひとこと要約

本稿では、人間の骨格を有向グラフとして表現することで階層的な関節関係を明示的に符号化する、U字型の条件付き有向グラフ畳み込みネットワーク(U-CondDGCN)を提案する。入力ポーズに条件づけられたグラフ畳み込みにより、適応的な非局所的依存関係を学習し、Human3.6MおよびMPI-INF-3DHPベンチマークで最先端の性能を達成した。ベースライン比で2.9mmの向上を達成した。

ABSTRACT

Graph convolutional networks have significantly improved 3D human pose estimation by representing the human skeleton as an undirected graph. However, this representation fails to reflect the articulated characteristic of human skeletons as the hierarchical orders among the joints are not explicitly presented. In this paper, we propose to represent the human skeleton as a directed graph with the joints as nodes and bones as edges that are directed from parent joints to child joints. By so doing, the directions of edges can explicitly reflect the hierarchical relationships among the nodes. Based on this representation, we further propose a spatial-temporal conditional directed graph convolution to leverage varying non-local dependence for different poses by conditioning the graph topology on input poses. Altogether, we form a U-shaped network, named U-shaped Conditional Directed Graph Convolutional Network, for 3D human pose estimation from monocular videos. To evaluate the effectiveness of our method, we conducted extensive experiments on two challenging large-scale benchmarks: Human3.6M and MPI-INF-3DHP. Both quantitative and qualitative results show that our method achieves top performance. Also, ablation studies show that directed graphs can better exploit the hierarchy of articulated human skeletons than undirected graphs, and the conditional connections can yield adaptive graph topologies for different poses.

研究の動機と目的

  • 3次元ポーズ推定における人間の骨格の階層的可動性を捉えるために、無向グラフ表現の限界を是正すること。
  • 歩行や食事といったポーズに応じて異なる、変化する非局所的関節依存関係をモデル化すること。
  • 空間的・時間的グラフ畳み込みと学習可能なポーズ条件付きトポロジーを統合することで、モノクロナル動画からの3次元ポーズ推定精度を向上させること。
  • 有向グラフが無向グラフよりも骨格の階層性をより効果的に活用できること、および条件付き接続が性能向上に寄与することを検証すること。
  • 大規模ベンチマーク(Human3.6MおよびMPI-INF-3DHP)において本手法の有効性を示すこと。

提案手法

  • 関節をノードとし、親関節から子関節への有向エッジを用いて、解剖学的階層を符号化する有向グラフとして人間の骨格を表現する。
  • 入力ポーズ特徴に基づいてグラフトポロジーを動的に調整する空間的・時間的条件付き有向グラフ畳み込み(ST-DGConv)を導入する。
  • 空間的・時間的コンテキストを保持するため、スキップ接続を備えたU字型エンコーダ・デコーダアーキテクチャを採用する。
  • 入力ポーズ埋め込みに基づいてノード間の接続重みを予測する条件付きエッジメカニズムを採用し、適応的非局所的依存関係を実現する。
  • グラフ畳み込みにおいてノードおよびエッジ特徴を活用し、局所的および長距離の関節関係を両方モデル化する。
  • 条件付き接続を主にUアーキテクチャのマージ段階に適用することで、事前知識の構造的整合性とポーズ固有の適応性のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ13次元ポーズ推定において、無向グラフと比較して有向グラフ表現が、人間の骨格の階層的構造をより効果的にモデル化できるか?
  • RQ2入力ポーズに条件づけられたグラフトポロジーが、適応的非局所的依存関係を可能にすることで性能向上をもたらすか?
  • RQ3条件付き接続の配置(例:ダウンサンプリング段階 vs. マージ段階)がモデルの性能および安定性に与える影響は何か?
  • RQ4入力シーケンス長が、提案フレームワークにおける3次元ポーズ推定の精度にどの程度影響を及えるか?
  • RQ5予測された条件付き接続は、歩行時の四肢間や食事時の右手と頭部間のような意味のあるポーズ固有の依存関係を視覚的に反映できるか?

主な発見

  • 提案されたU-CondDGCNは、Human3.6MおよびMPI-INF-3DHPで最先端の性能を達成し、マージ段階に条件付き接続を適用した場合、ベースラインのUGCNet比で2.9mmの向上を達成した。
  • アブレーションスタディにより、有向グラフが無向グラフを上回り、骨格の階層性をより正確にモデル化できることを確認した。
  • 条件付き接続は、異なるポーズが最適な非局所的依存関係を採用できるようにすることで、性能向上に顕著に寄与しており、学習された接続行列の可視化で裏付けられた。
  • 入力シーケンス長が延長するにつれて一貫した性能向上を示し、3次元ポーズ推論における時間的コンテキストの価値を裏付けた。
  • 1つの3次元ポーズあたり3.6msの推論速度を達成し、パラメータ数はわずか342万(3.42M)であり、VideoPose3D(1695万パラメータ)のような時空間畳み込みベースのモデルと比較して著しく少ない。
  • 予測された条件付き接続の可視化により、モデルが意味的でポーズ固有の依存関係(例:歩行時の左手首と右脚、食事時の右手と頭部間)を学習していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。