Skip to main content
QUICK REVIEW

[論文レビュー] 3D Human Shape and Pose from a Single Low-Resolution Image with Self-Supervised Learning

Xiangyu Xu, Hao Chen|arXiv (Cornell University)|Jul 27, 2020
Advanced Vision and Imaging参考文献 54被引用数 4
ひとこと要約

本稿では、自己教師あり学習および対照的学習を用いて、1枚の低解像度画像から3次元人体形状とポーズを推定する解像度に注意を払った深層畳み込みニューラルネットワーク、RSC-Netを提案する。解像度間で一貫性のある出力と特徴量を強制することで、高解像度の教師信号や超解像前処理を必要とせずに、最先端の性能を達成する。

ABSTRACT

3D human shape and pose estimation from monocular images has been an active area of research in computer vision, having a substantial impact on the development of new applications, from activity recognition to creating virtual avatars. Existing deep learning methods for 3D human shape and pose estimation rely on relatively high-resolution input images; however, high-resolution visual content is not always available in several practical scenarios such as video surveillance and sports broadcasting. Low-resolution images in real scenarios can vary in a wide range of sizes, and a model trained in one resolution does not typically degrade gracefully across resolutions. Two common approaches to solve the problem of low-resolution input are applying super-resolution techniques to the input images which may result in visual artifacts, or simply training one model for each resolution, which is impractical in many realistic applications. To address the above issues, this paper proposes a novel algorithm called RSC-Net, which consists of a Resolution-aware network, a Self-supervision loss, and a Contrastive learning scheme. The proposed network is able to learn the 3D body shape and pose across different resolutions with a single model. The self-supervision loss encourages scale-consistency of the output, and the contrastive learning scheme enforces scale-consistency of the deep features. We show that both these new training losses provide robustness when learning 3D shape and pose in a weakly-supervised manner. Extensive experiments demonstrate that the RSC-Net can achieve consistently better results than the state-of-the-art methods for challenging low-resolution images.

研究の動機と目的

  • 監視映像やスポーツ中継など、実世界の応用で一般的な低解像度画像からの3次元人体形状とポーズ推定の課題に対処すること。
  • 高解像度入力を必要とする既存手法の限界や、解像度間での一般化性能の低さを克服すること。
  • 実世界のデータセットに存在する高品質な3次元アノテーションの不足を補うために、解像度一貫性のある教師信号を用いた自己教師あり学習を活用すること。
  • 異なるスケールの特徴量間の相互情報量を最大化することで、特徴表現の耐障害性を向上させる対照的学習を用いて、解像度間の特徴一貫性を向上させること。
  • 別々のモデルや超解像前処理を必要とせず、任意の入力解像度に一般化可能な単一モデルを構築すること。

提案手法

  • 解像度に特化したパラメータを用いて特徴量を適応的に統合する一方で、複数の解像度間で共通の特徴抽出器を共有する解像度に注意を払ったネットワークアーキテクチャを提案する。
  • 同じ画像の異なる解像度における予測の整合性を強制する方向性のある自己教師あり損失を導入し、高解像度出力を低解像度入力のソフトな教師信号として用いる。
  • コサイン類似度に基づく対照的特徴損失を設計し、同じ画像の異なる解像度から抽出された深層特徴量間の相互情報量を最大化することで、特徴表現の耐障害性を向上させる。
  • 多様な解像度の入力から学習する際の最適化の安定化を図るため、段階的な訓練戦略を採用し、徐々に低解像度データを導入する。
  • 自己教師あり損失において階層的な監視を採用し、高解像度からの予測を低解像度予測のガイドとして用いることで、学習の安定性と精度を向上させる。
  • 解像度に注意を払ったネットワーク、自己教師あり損失、対照的特徴損失を統合した一貫性のある訓練目的を構築し、弱教師あり3次元推定を実現する。

実験結果

リサーチクエスチョン

  • RQ1再訓練や超解像処理を必要とせず、広範な低解像度入力に対して一貫した3次元人体形状とポーズ推定が可能な単一の深層畳み込みニューラルネットワークを構築できるか?
  • RQ2高品質な3次元アノテーションが不足している状況において、自己教師あり学習を効果的に活用することで3次元推定性能を向上させられるか?
  • RQ3対照的学習による特徴一貫性の強制は、標準的なMSEベースの損失関数と比較して、より優れた一般化性能と耐障害性をもたらすか?
  • RQ4高解像度のガイドを優先する方向性のある自己教師あり戦略は、対称的な自己教師あり学習と比較して、低解像度入力の性能向上に寄与するか?
  • RQ5段階的訓練は、多様な解像度を持つ3次元推定モデルの収束性と性能にどのような影響を及えるか?

主な発見

  • RSC-Netは、低解像度3次元人体ポーズおよび形状推定において最先端の性能を達成し、全テスト解像度で既存手法を上回る。
  • 解像度に注意を払ったネットワーク、自己教師あり損失、対照的特徴損失の組み合わせにより、最低解像度(32×32)でのMPJPEが96.36に低下し、段階的訓練を実施しないベースライン(105.11)を著しく上回る。
  • 方向性のある自己教師あり損失(8)は、元の対称的自己教師あり損失(143.31 vs. 105.11)と比較して、32×32解像度でMPJPEを8.75低下させ、高解像度のガイドを有効に活用できることを示している。
  • 対照的特徴損失(CL)はMSEベースの特徴一貫性損失(MS)を上回り、32×32解像度でMPJPEを11.44低下(117.12 vs. 128.56)させ、高次元特徴量の整合性向上における優位性を確認した。
  • 段階的訓練は不可欠である:これを省略すると、32×32解像度でのMPJPEが8.75上昇(127.05 vs. 117.12)し、多様な解像度データに対する学習の安定化に果たす役割を示している。
  • 完全なモデル(RA+SS+CL)は、32×32解像度で58.98 MPJPE-PAを達成し、超解像前処理なしで極めて低解像度の入力に対しても耐障害性と一般化性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。