[論文レビュー] 3D Human Pose, Shape and Texture from Low-Resolution Images and Videos
本稿では、自己教師あり学習と対照的学習を用いて、低解像度の画像および動画から3次元人体ポーズ、形状、テクスチャを推定する解像度に敏感な深層畳み込みニューラルネットワークRSC-Netを提案する。1つのモデルで複数の解像度において最先端の性能を達成し、超解像処理や解像度別に最適化された学習に起因する制限を克服する。
3D human pose and shape estimation from monocular images has been an active research area in computer vision. Existing deep learning methods for this task rely on high-resolution input, which however, is not always available in many scenarios such as video surveillance and sports broadcasting. Two common approaches to deal with low-resolution images are applying super-resolution techniques to the input, which may result in unpleasant artifacts, or simply training one model for each resolution, which is impractical in many realistic applications. To address the above issues, this paper proposes a novel algorithm called RSC-Net, which consists of a Resolution-aware network, a Self-supervision loss, and a Contrastive learning scheme. The proposed method is able to learn 3D body pose and shape across different resolutions with one single model. The self-supervision loss enforces scale-consistency of the output, and the contrastive learning scheme enforces scale-consistency of the deep features. We show that both these new losses provide robustness when learning in a weakly-supervised manner. Moreover, we extend the RSC-Net to handle low-resolution videos and apply it to reconstruct textured 3D pedestrians from low-resolution input. Extensive experiments demonstrate that the RSC-Net can achieve consistently better results than the state-of-the-art methods for challenging low-resolution images.
研究の動機と目的
- 監視映像やスポーツ動画で一般的な低解像度画像からの3次元人体ポーズおよび形状推定の課題に対処すること。
- 高解像度入力や超解像処理に依存する従来の手法が引き起こすアーティファクトやドメインギャップの制限を克服すること。
- 再訓練や解像度別に最適化された適応処理を必要とせず、任意の画像解像度に一般化可能な統合的深層学習モデルを開発すること。
- 3次元アノテーションが疎であるという弱教師あり学習の問題を、自己教師あり学習および対照的学習戦略を導入することで緩和すること。
- 低解像度動画入力からテクスチャ付き3次元歩行者を再構築する方法に拡張すること。
提案手法
- 解像度に応じたパラメータを有する共有特徴抽出器と解像度に敏感なパラメータを備えたRSC-Netを提案し、異なる解像度間で特徴を適応的に統合する。
- 同一画像を異なる解像度で処理した予測間のスケール整合性を強制する方向性のある自己教師あり損失を導入し、高解像度出力をガイドとして用いる。
- 解像度間で深層特徴表現の一貫性を強制するため、特徴間の相互情報量を最大化する対照的損失を用いた対照的学習スキームを採用する。
- 自己教師あり損失において階層的な監視戦略を採用し、高解像度予測を低解像度予測のソフトターゲットとして用いる。
- グローバルコンテキストモジュールとアップサンプリング層を備えたエンコーダデコーダアーキテクチャを採用し、テクスチャ推定ネットワークにおけるUVマップ品質を向上させる。
- 最適化の安定性と収束性を向上させるために、高解像度から低解像度へと段階的に訓練を進めるプログレッシブトレーニングを採用する。
実験結果
リサーチクエスチョン
- RQ1解像度別に微調整を行わず、広範な低解像度画像解像度において、1つの深層畳み込みニューラルネットワークが3次元人体ポーズおよび形状を効果的に推定できるか?
- RQ23次元アノテーションが疎または存在しない状況で、自己教師あり学習をどのように活用すれば3次元推定の性能を向上させられるか?
- RQ3平均二乗誤差損失と比較して、対照的学習が解像度間で特徴表現の一貫性をより効果的に向上させられるか?
- RQ4プログレッシブトレーニングは、複数の解像度の低解像度入力に対して、モデルの安定性と性能をどの程度向上させるか?
- RQ5提案手法は動画入力に対しても一般化可能であり、低解像度動画シーケンスから高品質なテクスチャ付き3次元歩行者を再構築できるか?
主な発見
- RSC-Netは、複数のベンチマークで低解像度3次元人体ポーズおよび形状推定において最先端の性能を達成し、既存のSOTA手法を上回る。
- アブレーションスタディにより、解像度に敏感なネットワーク、自己教師あり学習、対照的学習の各要素が性能向上に顕著に寄与していることが確認された。
- 高解像度予測の信頼性を活用することで、元の対称的自己教師あり損失よりも優れた性能を発揮する方向性のある自己教師あり損失が、高解像度出力の劣化を低減した。
- 対照的特徴損失はMSEよりも優れた特徴表現をもたらし、解像度間の一貫性と3次元推定精度の両面で性能向上が確認された。
- グローバルコンテキストモジュールとアップサンプリング層を備えたテクスチャ推定ネットワークは、より高品質なUVマップを生成し、ポイントワイズ和集合融合法が連結法を上回る性能を発揮した。
- 本手法は動画入力に対しても良好に一般化可能であり、低解像度動画シーケンスから高品質なテクスチャ付き3次元歩行者再構築を実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。