Skip to main content
QUICK REVIEW

[論文レビュー] TRB: A Novel Triplet Representation for Understanding 2D Human Body

Haodong Duan, Kwan-Yee Lin|arXiv (Cornell University)|Oct 25, 2019
Human Pose and Action Recognition参考文献 43被引用数 4
ひとこと要約

本稿では、ポーズのためのスケルトンキーポoinと、形状のためのホロウキーポイントを組み合わせた、より豊かで柔軟なボディ理解を可能にする、新しい2次元人体表現である「トリプレット表現(TRB)」を提案する。著者らは、X構造、方向性畳み込み、ペairワイマッピングを備えた2本のブランチを持つTRB-Netを導入し、ポーズと形状を同時に推定することで、スケルトンキーポイントタスクとホロウキーポイントタスクでそれぞれ13.3%および15.1%の誤差低減を達成し、最先端手法を上回る性能を発揮した。

ABSTRACT

Human pose and shape are two important components of 2D human body. However, how to efficiently represent both of them in images is still an open question. In this paper, we propose the Triplet Representation for Body (TRB) -- a compact 2D human body representation, with skeleton keypoints capturing human pose information and contour keypoints containing human shape information. TRB not only preserves the flexibility of skeleton keypoint representation, but also contains rich pose and human shape information. Therefore, it promises broader application areas, such as human shape editing and conditional image generation. We further introduce the challenging problem of TRB estimation, where joint learning of human pose and shape is required. We construct several large-scale TRB estimation datasets, based on popular 2D pose datasets: LSP, MPII, COCO. To effectively solve TRB estimation, we propose a two-branch network (TRB-net) with three novel techniques, namely X-structure (Xs), Directional Convolution (DC) and Pairwise Mapping (PM), to enforce multi-level message passing for joint feature learning. We evaluate our proposed TRB-net and several leading approaches on our proposed TRB datasets, and demonstrate the superiority of our method through extensive evaluations.

研究の動機と目的

  • ポーズと形状の両方の情報を捉える統一的な2次元人体表現が不足している問題に対処すること。
  • 2次元画像からポーズと形状を同時に学習する必要がある、TRB推定という新しいタスクのベンチマークを確立すること。
  • スケルトンキーポイントとホロウキーポイントの表現を同時に効果的に学習できるマルチタスクディープラーニングフレームワークを開発すること。
  • TRBが、条件付き画像生成や人体形状編集といった高レベルのビジョンタスクにおいて実用的であることを示すこと。

提案手法

  • スケルトンキーポイント(ポーズ用)とホロウキーポイント(形状用)を統合したコンactな2次元表現として、トリプレット表現(TRB)を提案する。
  • LSP、MPII、COCOに基づいてホロウキーポイントをアノテートすることで、大規模なTRB推定データセットを構築し、ベンチマーク評価を可能にする。
  • 共有特徴学習を活用してスケルトンとホロウキーポイントを同時に推定する2本のブランチを持つTRB-Netを設計する。
  • X構造(Xs)を導入し、スケルトンブランチとホロウブランチ間で複数レベルの特徴交換を可能にするメッセージパッシングブロックを構築する。
  • 特徴マップ間の内側から外側、外側から内側への空間的関係をモデル化するタスク特化型畳み込み演算子として、方向性畳み込み(DC)を提案する。
  • スケルトンブランチとホロウブランチの予測の一貫性を強制する制約として、ペアワイズマッピング(PM)を実装し、一般化性能の向上を図る。

実験結果

リサーチクエスチョン

  • RQ1統一的な2次元人体表現は、関節的なポーズと意味的な形状情報を効果的に捉えることができるか?
  • RQ2ポーズと形状の共同学習は、単一タスクアプローチを上回るキーポイント推定の精度向上に寄与するか?
  • RQ3ホロウキーポイントは、ポーズ推定および形状に配慮した画像生成において、どの程度性能を向上させるか?
  • RQ4TRBは、条件付き画像生成や人体形状編集といった実用的応用をサポートできるか?

主な発見

  • TRB-Netは、最先端手法と比較して、スケルトンキーポイント推定で13.3%の誤差低減、ホロウキーポイント推定で15.1%の誤差低減を達成した。
  • LSPデータセットでは、TRB-NetがPCK@0.2で94.5%を達成し、特に手首や足首といった困難なキーポイント位置において、顕著な性能向上を示した。
  • MPIIデータセットでは、TRB-Netがmean PCKh@0.5で92.2%を達成し、MPIIのみで訓練された手法を大きく上回り、LIPやLSPなどの追加データを使用するモデルに対しても競争力を持つ結果となった。
  • COCOからの訓練データを半分にした場合でも、TRB-Net(hg2-ours_sub)は、フルデータセットで訓練されたベースラインモデルと同等の性能を達成した。これは、TRB表現の効率性を示している。
  • TRBに基づく条件付き画像生成フレームワークは、ポーズおよび形状ガイド付きの画像合成と明示的な人体形状編集を成功裏に実現し、制御性と視覚的品質の両面でベースライン手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。