Skip to main content
QUICK REVIEW

[論文レビュー] CLIFF: Carrying Location Information in Full Frames into Human Pose and Shape Estimation

Zhihao Li, Jianzhuang Liu|arXiv (Cornell University)|Aug 1, 2022
Human Pose and Action Recognition被引用数 13
ひとこと要約

CLIFFは、トップダウン手法においてクロップされた領域から失われるグローバルな位置情報の欠落を補うために、フルフレームからのグローバル位置情報を取り入れることで、3次元人体ポーズおよび形状推定を向上させることを提案する。バウンディングボックス特徴量とフルフレーム2次元再投影損失を用いて、正確なグローバル回転推定を可能にする。SOTA性能を達成し、AGORA SMPL-Algorithmsトラックで1位を獲得し、3DPWでは54.8mmのPA-MPJPEを記録した。

ABSTRACT

Top-down methods dominate the field of 3D human pose and shape estimation, because they are decoupled from human detection and allow researchers to focus on the core problem. However, cropping, their first step, discards the location information from the very beginning, which makes themselves unable to accurately predict the global rotation in the original camera coordinate system. To address this problem, we propose to Carry Location Information in Full Frames (CLIFF) into this task. Specifically, we feed more holistic features to CLIFF by concatenating the cropped-image feature with its bounding box information. We calculate the 2D reprojection loss with a broader view of the full frame, taking a projection process similar to that of the person projected in the image. Fed and supervised by global-location-aware information, CLIFF directly predicts the global rotation along with more accurate articulated poses. Besides, we propose a pseudo-ground-truth annotator based on CLIFF, which provides high-quality 3D annotations for in-the-wild 2D datasets and offers crucial full supervision for regression-based methods. Extensive experiments on popular benchmarks show that CLIFF outperforms prior arts by a significant margin, and reaches the first place on the AGORA leaderboard (the SMPL-Algorithms track). The code and data are available at https://github.com/huawei-noah/noah-research/tree/master/CLIFF.

研究の動機と目的

  • クロップ処理によって失われるグローバル位置情報の欠落が、グローバル回転推定に誤差をもたらすというトップダウン3次元人体ポーズ推定手法の限界を是正すること。
  • 特に元のカメラ座標系におけるグローバル回転の精度を向上させるために、フルイメージからの包括的コンテキストを活用してアーティキュレートなポーズ推定を改善すること。
  • CLIFFのグローバル位置情報に敏感な監視を用いて、野外の2次元データセットに対して高品質な疑似真値アノテーターを開発し、回帰ベースのモデルに対するより良い完全監視を可能にすること。
  • クロップされた画像による監視が引き起こす曖昧さを軽減し、2次元再投影損失の歪みとポーズ最適化の誤った誘導を防ぐこと。

提案手法

  • CLIFFは、トップダウンモデルの入力を、クロップされた画像特徴量とバウンディングボックス座標を連結することで拡張し、元の画像内での空間的位置とスケールを符号化する。
  • 2次元再投影損失をフルフレーム空間で計算し、予測された3次元ジョイントを元の画像平面に再投影することで、実際の透視変形を模倣する。
  • 標準的な3次元キーポイントおよびメッシュ損失に加え、グローバル回転を監視するためのフルフレーム2次元再投影損失を組み合わせた損失関数でモデルを訓練する。
  • CLIFFのアーキテクチャを用いて、フルイメージ監視を活用して2次元キーポイントから高品質な3次元アノテーションを生成する、新しい疑似真値(pseudo-GT)アノテーターを訓練する。
  • SMPLモデルが持つ強力な暗黙の事前知識を保持しつつ、バウンディングボックス特徴量によって位置情報を明示的に符号化することで、一般化性能を向上させる。
  • HMRなどの既存のトップダウンモデルと互換性があり、グローバルオブジェクト回転を含む他の3次元推定タスクへも拡張可能である。

実験結果

リサーチクエスチョン

  • RQ1フルフレームからのグローバル位置情報を取り入れることで、3次元人体ポーズ推定におけるグローバル回転推定の精度が向上するか?
  • RQ2クロップ領域ではなくフルフレーム空間で2次元再投影損失を計算することで、アーティキュレートなポーズ予測が改善されるか?
  • RQ3CLIFFベースの疑似真値アノテーターは、野外の2次元データセットに対して高品質な3次元アノテーションを生成でき、下流の回帰性能を向上させられるか?
  • RQ4標準ベンチマークにおいて、CLIFFは既存のトップダウン手法と比較してグローバル回転およびポーズ精度で優れているか?

主な発見

  • CLIFFは3DPWベンチマークで54.8mmのPA-MPJPEを達成し、SPIN(66.9mm)やEFT(60.7mm)といった先行手法を上回った。
  • Human3.6Mでは、MPJPEを85.4mm、PVEを100.5mmにまで低減し、ベースラインのHMRや先行SOTA手法を顕著に上回った。
  • アブレーションスタディにより、バウンディングボックス入力(CI)とフルフレーム再投影損失(CS)の両方が不可欠であることが確認され、いずれかを削除するとMPJPEが10mm以上上昇した。
  • CLIFFベースの疑似真値アノテーターは、4台のV100 GPUを用いて35,515枚の画像に対してわずか30分で高品質な3次元アノテーションを生成し、EFTのような微調整手法を上回るスピードと精度を達成した。
  • COCOでCLIFFが生成した疑似真値で学習したモデルは、EFTベースの監視と比較して、3DPWでMPJPEが13.2mm改善され、PVEが20.5mm改善された。
  • CLIFFはAGORAリーダーボードのSMPL-Algorithmsトラックで1位を獲得し、現実的で制約のない環境下でもSOTA性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。