Skip to main content
QUICK REVIEW

[論文レビュー] Look into Person: Joint Body Parsing & Pose Estimation Network and A New Benchmark

Xiaodan Liang, Ke Gong|arXiv (Cornell University)|Apr 5, 2018
Human Pose and Action Recognition参考文献 45被引用数 11
ひとこと要約

本稿では、19の意味的ボディパーツおよび16のキーポints関節をラベル付けした50,462枚の画像を含む大規模なデータセット「Look into Person (LIP) benchmark」を紹介し、マルチスケール特徴量と反復的リファインメントを用いて構造的プライアーオリエンテーションを活用する、同時的人間パーツ解析とポーズ推定を実現するネットワーク(JPPNet)を提案する。このアプローチにより、同時にパーツ解析とポーズ推定の両性能が向上し、オクルージョンや複雑なポーズに強い汎用性と耐性を示し、性能面で最先端の結果を達成した。

ABSTRACT

Human parsing and pose estimation have recently received considerable interest due to their substantial application potentials. However, the existing datasets have limited numbers of images and annotations and lack a variety of human appearances and coverage of challenging cases in unconstrained environments. In this paper, we introduce a new benchmark named "Look into Person (LIP)" that provides a significant advancement in terms of scalability, diversity, and difficulty, which are crucial for future developments in human-centric analysis. This comprehensive dataset contains over 50,000 elaborately annotated images with 19 semantic part labels and 16 body joints, which are captured from a broad range of viewpoints, occlusions, and background complexities. Using these rich annotations, we perform detailed analyses of the leading human parsing and pose estimation approaches, thereby obtaining insights into the successes and failures of these methods. To further explore and take advantage of the semantic correlation of these two tasks, we propose a novel joint human parsing and pose estimation network to explore efficient context modeling, which can simultaneously predict parsing and pose with extremely high quality. Furthermore, we simplify the network to solve human parsing by exploring a novel self-supervised structure-sensitive learning approach, which imposes human pose structures into the parsing results without resorting to extra supervision. The dataset, code and models are available at http://www.sysu-hcp.net/lip/.

研究の動機と目的

  • 制約のない環境における、人間パーツ解析とポーズ推定のための、大規模で多様性に富み、かつ挑戦的なデータセットの不足に対処すること。
  • パーツ解析とポーズ推定の内在的相関を活用する統合的ディーブラーニングフレームワークを構築し、性能を向上させること。
  • 過学習を防ぎ、将来的な手法の公平な評価を可能にするために、非公開のテストセットを備えた公開ベンチマークを提供すること。
  • ポーズ推定から得られる構造的プライアーオリエンテーションが、曖昧またはオクルージョン状態にある領域のパーツ解析精度をどの程度向上させるかを検証すること。
  • 追加の教師信号なしに、自己教師型構造感受性学習を用いて、耐性と汎用性を向上させるパーツ解析の性能向上の可能性を検討すること。

提案手法

  • 19の意味的パーツと16のボディ関節をラベル付けした、50,462枚の画像を含む、大規模な新規ベンチマーク「Look into Person (LIP)」を提案。多様なポーズ、オクルージョン、背景をカバーする。
  • 両タスク間で特徴量を共有する、同時的人間パーツ解析とポーズ推定ネットワーク(JPPNet)を導入。マルチスケール畳み込み特徴量と反復的リファインメントを用いた粗〜細の戦略を採用。
  • 追加のポーズアノテーションを必要とせず、人間のボディ関節構造をパーツ解析予測に組み込む自己教師型構造感受性学習モジュールを採用。
  • マルチタスク学習フレームワークを用い、パーツ解析とポーズ推定を同時に最適化することで、相互監視とより良い文脈モデリングを実現。
  • 予測の空間的一致性を向上させるために、条件付きランダムフィールド(CRFs)とスキップ接続を適用。
  • 非公開のテストセットを備えた公開評価サーバーを導入し、モデル性能の公平かつ信頼性の高いベンチマーク評価を実現。

実験結果

リサーチクエスチョン

  • RQ1人間パーツ解析とポーズ推定を同時に学習することで、独立した学習に比べて性能がどの程度向上するか?
  • RQ2曖昧またはオクルージョン状態にある領域において、ポーズ推定から得られる構造的プライアーオリエンテーションが、パーツ解析精度をどの程度向上させるか?
  • RQ3自己教師型構造感受性学習は、追加のポーズアノテーションなしに、効果的にパーツ解析を向上させることができるか?
  • RQ4提案されたJPPNetモデルは、多様で挑戦的な制約のない状況において、どの程度汎用性を示すか?
  • RQ5マルチスケール特徴量と反復的リファインメントは、パーツ解析とポーズ推定の性能にどのような影響を与えるか?

主な発見

  • 提案されたJPPNetは、LIPパーツ解析ベンチマークにおいて、全体精度86.48%、平均精度62.25%、平均IoU 51.36%を達成し、既存手法を上回った。
  • マルチスケール特徴量と二段階のリファインメントを備えた統合モデルは、ベースラインに比べて平均IoUが1.8%向上した。
  • 反復的リファインメントにより、ポーズ推定性能が顕著に向上し、MPIIテストセットにおける平均関節精度が1.6%向上した。
  • 関節構造情報を利用することで、左/右腕・脚のラベルの曖昧さを効果的に解消した。
  • アブレーションスタディの結果、パーツ解析とポーズ推定のモジュールを分離すると性能が劣化することが確認され、統合的モデリングの有効性が裏付けられた。
  • MPIIデータセットへの一般化性能が高く、制約のない現実世界のシナリオにおいても強力な転送性と耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。