[論文レビュー] NeuralAnnot: Neural Annotator for in-the-wild Expressive 3D Human Pose and Mesh Training Sets.
NeuralAnnot は、マルチサンプルモデリングと補助的な3D教師信号を活用することで、実環境画像に対して高品質な疑似教師データとしての3D人体ポーズおよびメッシュデータを、効率的に生成するニューラルネットワークベースのアノテーターです。従来の1サンプルごとの最適化手法が抱える深度の曖昧さと長時間の最適化を克服し、トレーニングデータの品質を著しく向上させ、表現力のある3D人体ポーズ推定で最先端の性能を達成しています。
Recovering expressive 3D human pose and mesh from in-the-wild images is greatly challenging due to the absence of the training data. Several optimization-based methods have been used to obtain 3D human model fits from GT 2D poses, which serve as pseudo-groundtruth (GT) 3D poses and meshes. However, they often suffer from severe depth ambiguity while requiring long running time because of their per-sample optimization that only uses 2D supervisions and priors. The per-sample optimization optimizes a 3D human model on each sample independently; therefore, running it on a large number of samples consumes long running time. In addition, the absence of the 3D supervisions makes their framework suffer from depth ambiguity. To overcome the limitations, we present NeuralAnnot, a neural annotator that learns to construct in-the-wild expressive 3D human pose and mesh training sets. Our NeuralAnnot is trained on entire datasets by considering multiple samples together with additional 3D supervisions from auxiliary datasets; therefore, it produces far better 3D pseudo-GT fits much faster. We show that the newly obtained training set brings great performance gain, which will be publicly released with codes.
研究の動機と目的
- 実環境画像における表現力のある3D人体ポーズおよびメッシュのトレーニングデータの不足に対処すること。
- 2D教師信号に依存する1サンプルごとの最適化手法に内在する深度の曖昧さと長時間の実行時間を克服すること。
- 補助的な3Dデータセットと複数サンプルの共同モデリングを活用して、疑似GT 3Dフィットの品質を向上させること。
- スケーラブルで高速かつ高精度な方法を構築し、表現力のある3D人体ポーズおよびメッシュ推定のための大規模トレーニングデータセットを生成すること。
- 優れた公開トレーニングデータセットを提供することで、下流の3D人体ポーズ推定の性能向上を実現すること。
提案手法
- 複数の実環境画像を同時に処理するように、2Dキーポイント教師信号から3D人体ポーズおよびメッシュを予測するニューラルネットワーク NeuralAnnot を学習する。
- 外部の3Dデータセットからの補助的3D教師信号を統合し、ネットワークが正確な深度および形状の事前分布を学習できるようにする。
- 複数サンプル間の関係性をモデリングする共同最適化フレームワークを用いて、深度の一貫性を向上させ、曖昧さを低減する。
- 1サンプルごとの反復的最適化を、1回の効率的なニューラル推論パスに置き換えることで、トレーニング時間を著しく短縮する。
- 微分可能で微分可能な3D人体ボディモデルを活用し、2D教師信号からのエンドツーエンドの3Dフィット学習を可能にする。
- 訓練中に正則化および幾何的事前分布を適用し、現実的で一貫性のある3Dメッシュおよびポーズ出力を保証する。
実験結果
リサーチクエスチョン
- RQ11サンプルごとの最適化を一切行わず、2D教師信号からのみ3D人体ポーズおよびメッシュアノテーションを効果的に学習できるニューラルネットワークは、本当に実現可能か?
- RQ2補助的な3Dデータを活用することで、実環境設定における疑似GT 3Dフィットの深度精度と現実性はどの程度向上するか?
- RQ3複数サンプルの共同モデリングは、独立した1サンプルごとの最適化と比較して、深度の曖昧さをどの程度低減できるか?
- RQ4提案手法は、3Dフィット品質を維持または向上させつつ、推論時間を著しく短縮できるか?
- RQ5得られたトレーニングデータセットは、下流の3D人体ポーズ推定モデルにおいて測定可能な性能向上をもたらすか?
主な発見
- NeuralAnnot は、従来の1サンプルごとの最適化手法と比較して、深度の曖昧さを共同モデリングによって著しく低減し、より正確な3Dポーズおよびメッシュ予測を生成する。
- 反復的1サンプル最適化を1回のニューラル推論パスに置き換えることで、著しい高速化を達成する。
- 補助的な3Dデータの活用により、生成された3D疑似GTアノテーションの現実性と幾何的整合性が向上する。
- 得られたトレーニングデータセットは、下流の3D人体ポーズ推定ベンチマークで測定可能な性能向上をもたらす。
- 著者らは、生成されたトレーニングデータセットおよびコードを公開しており、広範な採用と再現可能性を促進している。
- ニューラルアノテーターは、多様な実環境画像の分布にわたって良好に一般化しており、オクルージョンや複雑なポーズに対しても頑健であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。