Skip to main content
QUICK REVIEW

[論文レビュー] AlignSDF: Pose-Aligned Signed Distance Fields for Hand-Object Reconstruction

Zerui Chen, Yana Hasson|arXiv (Cornell University)|Jul 26, 2022
Human Pose and Action Recognition被引用数 8
ひとこと要約

本稿では、パラメトリックな手および物体モデルと符号付き距離関数(SDF)を組み合わせることで、単眼RGB画像からの3D手・物体再構築を向上させる、新しいフレームワークAlignSDFを提案する。ポーズと形状の学習を分離し、推定されたMANOおよび物体ポーズパラメータを用いてSDFを標準化されたポーズにアライメントさせることで、特に手・物体相互作用のモデリングにおいて最先端の精度と詳細な再構築を達成する。

ABSTRACT

Recent work achieved impressive progress towards joint reconstruction of hands and manipulated objects from monocular color images. Existing methods focus on two alternative representations in terms of either parametric meshes or signed distance fields (SDFs). On one side, parametric models can benefit from prior knowledge at the cost of limited shape deformations and mesh resolutions. Mesh models, hence, may fail to precisely reconstruct details such as contact surfaces of hands and objects. SDF-based methods, on the other side, can represent arbitrary details but are lacking explicit priors. In this work we aim to improve SDF models using priors provided by parametric representations. In particular, we propose a joint learning framework that disentangles the pose and the shape. We obtain hand and object poses from parametric models and use them to align SDFs in 3D space. We show that such aligned SDFs better focus on reconstructing shape details and improve reconstruction accuracy both for hands and objects. We evaluate our method and demonstrate significant improvements over the state of the art on the challenging ObMan and DexYCB benchmarks.

研究の動機と目的

  • 単眼RGB画像からの詳細な3D手・物体相互作用の再構築という課題に取り組む。既存手法は形状の詳細と相互作用の忠実性の両面で課題を抱えている。
  • パラメトリックメッシュモデルの制限(形状変形と解像度の制限)と、SDFベース手法の欠如する明示的な幾何的事前知識を克服する。
  • 手用のMANO、物体用の物体変換というパラメトリックモデルからの事前知識をSDF学習に統合し、形状再構築の精度を向上させる。
  • ポーズと形状の学習を分離することで、グローバル変換(回転と平行移動)を正規化し、SDF学習を単純化する。
  • ポーズ正規化された標準空間にSDFをアライメントさせることで、高精度で接触を考慮した手・物体の再構築を実現する。

提案手法

  • 手ポーズをMANOネットワークで推定し、その標準手ポーズ(親指の回転と平行移動)を取得することで、SDF空間を正規化する。
  • 専用の物体ポーズネットワークを用いて物体の並進を推定し、それを用いて物体SDF空間を標準フレームに正規化する。
  • それぞれのポーズ正規化標準空間において、手と物体用に別々のSDFネットワークを学習させ、SDFが形状の詳細にのみ集中できるようにする。
  • アブレーションの上限ベースラインとして、訓練時に真値の手ポーズと推定された物体並進を使用する。
  • 分離表現を活用することで、グローバルポーズの変動に対する感受性を低減し、一般化性能を向上させる。
  • 形状再構築、ポーズ推定、および相互作用指標(接触率、貫通深さ)を組み合わせたマルチタスク損失を用いて、モデルをエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1パラメトリックモデルからの明示的なポーズ事前知識が、3D手・物体再構築のための暗黙的SDF表現の学習を改善できるか?
  • RQ2ポーズと形状の学習を分離することで、統合最適化と比較して再構築精度と詳細忠実度が向上するか?
  • RQ3ポーズにアライメントされたSDFは、標準SDFやメッシュベース手法と比較して、接触や貫通といった細粒度の手・物体相互作用をより良くモデル化できるか?
  • RQ4DexYCBのような実世界ベンチマークにおいて、提案手法は最先端のアプローチと比較してどの程度の性能を示すか?
  • RQ5標準ポーズへのアライメントは、SDF学習の複雑さをどの程度低減し、一般化性能を向上させるか?

主な発見

  • 提案手法は、実世界のDexYCBベンチマークにおいて、手表面誤差(H_se)を29.4%、物体表面誤差(O_se)を20.5%改善し、先行SOTAを上回る。
  • ObManにおいて、完全モデル(g)はベースラインと比較してH_seを6.4%、H_veを8.8%低減し、ポーズ正規化の有効性を示している。
  • DexYCBでは接触率(C_r)が96.1%に達し、テストサンプルの96%以上で再構築された手と物体が接触していることを示している。
  • 貫通深さ(P_d)は0.71 mmに、交差体積(I_v)は3.45 mm³にまで低下し、先行手法と比較して相互作用の現実性が向上している。
  • 定性的な結果では、特に複雑な手・物体構成において、細い構造や微細なディテールの再構築が顕著に優れている。
  • アブレーションスタディにより、ポーズ正規化がO_seを4.09から3.36 cm²にまで低減し、SDF学習の効率性を向上させることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。