[論文レビュー] Learning Anthropometry from Rendered Humans
本論文は、3次元再構築を経由せずに2次元RGB画像から身体測定値を直接推定するためのディープラーニングフレームワークを提案する。新たに4,149件の3次元身体スキャンと、テープメジャーによる真値を有する200名分の実世界RGBデータセットを構築し、部位ベースの形状モデルと回帰ベースのニューラルネットワークを用いることで、測定値推定および形状再構築の分野で最先端の性能を達成した。
Accurate estimation of anthropometric body measurements from RGB images has many potential applications in industrial design, online clothing, medical diagnosis and ergonomics. Research on this topic is limited by the fact that there exist only generated datasets which are based on fitting a 3D body mesh to 3D body scans in the commercial CAESAR dataset. For 2D only silhouettes are generated. To circumvent the data bottleneck, we introduce a new 3D scan dataset of 2,675 female and 1,474 male scans. We also introduce a small dataset of 200 RGB images and tape measured ground truth. With the help of the two new datasets we propose a part-based shape model and a deep neural network for estimating anthropometric measurements from 2D images. All data will be made publicly available.
研究の動機と目的
- ビジョンベースの身体測定モデルの学習および評価に用いることができる、公開可能な実RGBデータセットに、身体測定真値が付与されたものが不足しているという問題に対処すること。
- 中間の3次元ボディメッシュ再構築を必要とせずに、1枚のRGB画像から34の身体測定値を正確に推定すること。
- グローバルなPCAベースのモデルよりも、局所的な身体部位の変動をより効果的に捉えることができる部位ベースの形状モデルを開発すること。
- ドメイン適応技術を用いて、合成学習データと実世界応用との間のドメインギャップを埋めること。
- 4,149件の3次元スキャンと200枚の実RGB画像(テープメジャーによる真値付)を含む2つの新規データセットを公開すること。
提案手法
- 著者らは、2,675名の女性および1,474名の男性の3次元身体スキャンから成る新規データセットを構築し、テクスチャ付きボディメッシュにフィットさせた。
- 一貫したレンダリング条件を用いて3次元スキャンから合成RGB画像を生成し、画像から測定値への直接回帰を学習するためのディープニューラルネットワークを訓練した。
- 身体部位(例:上半身、骨盤)に対してPCAを適用することで、部位ベースの形状モデルを構築し、局所的な形状変動をよりよく捉えた。
- 深層畳み込みニューラルネットワークを用いて、2次元画像特徴量から34の身体測定値への直接回帰を実行するネットワークアーキテクチャを設計した。
- 予測された測定値から、部位ベースモデルの形状係数への学習済み線形マッピングを用いてボディシェイプを再構築した。
- 実世界の200枚の画像データセット上で非線形回帰器を訓練し、合成データからの予測を実世界データに適応させることで、ドメイン一般化性能を向上させた。
実験結果
リサーチクエスチョン
- RQ1レンダリングされた合成画像で学習したディープニューラルネットワークは、実世界のRGB画像から身体測定値を高精度に推定できるか?
- RQ2部位ベースの形状モデルは、グローバルPCAベースのモデルに比べて、局所的な身体形状の変動をどれほど効果的に捉えられるか?
- RQ3実データでファインチューニングされた場合、合成学習データが実世界の測定推定にどの程度一般化できるか?
- RQ43次元スキャンから自己定義された測定値と、実応用におけるテープメジャー真値との間に、どの程度の性能ギャップが生じるか?
- RQ5まず3次元メッシュを再構築する手法に比べて、画像から測定値への直接回帰アプローチは、性能で優れているか?
主な発見
- 評価において、XXX-fitsデータセットを用いた結果、頭囲みの平均絶対誤差(MAE)が23.1 mm、首回りのMAEが15.4 mmという、最先端の性能を達成した。
- CAESAR-fitsデータセットでは、頭囲みのMAEが10.7 mm、首回りのMAEが12.1 mmであり、シルエット依存の従来手法を上回った。
- レンダリング画像で学習したネットワークは、実世界の画像へも良好に一般化され、XXX-real-200データセットにおいて全身の高さのMAEが29.8 mmを記録したが、ドメインシフトの影響を受けても競争力のある性能を示した。
- 部位ベースの形状モデルは、グローバルPCAモデルに比べて再構築誤差を低減し、特に局所的測定値(上腕二頭筋:13.0 mm MAE、前腕:8.9 mm MAE)において顕著な改善が得られた。
- 実世界200枚の画像データセット上で非線形回帰器を用いることでドメインギャップが低減され、実データにおける性能が向上したが、産業用途への適用にはさらなる適応が必要である。
- 著者らは、4,149件の3次元スキャンと200枚の実RGB画像(テープメジャー真値付)を含む、公開可能な最初のデータセットをリリースした。これにより、ビジョンベースの身体測定分野における今後の研究が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。