[論文レビュー] What's in your hands? 3D Reconstruction of Generic Objects in Hands
本論文は、1枚のRGB画像から人間の手で保持されている一般化された未知の物体の3次元再構成を、関節可動性に配慮した手のポーズを条件付き事前分布として用いることで、新規に提案する。視覚特徴と手中心の座標系に基づく条件付き入力を持つ暗黙的ニューラルネットワークを用いることで、複数のデータセットで最先端の性能を達成し、ベースラインを大きく上回り、テスト時最適化を可能にすることで、物体および手のポーズ推定の精度が向上する。
Our work aims to reconstruct hand-held objects given a single RGB image. In contrast to prior works that typically assume known 3D templates and reduce the problem to 3D pose estimation, our work reconstructs generic hand-held object without knowing their 3D templates. Our key insight is that hand articulation is highly predictive of the object shape, and we propose an approach that conditionally reconstructs the object based on the articulation and the visual input. Given an image depicting a hand-held object, we first use off-the-shelf systems to estimate the underlying hand pose and then infer the object shape in a normalized hand-centric coordinate frame. We parameterized the object by signed distance which are inferred by an implicit network which leverages the information from both visual feature and articulation-aware coordinates to process a query point. We perform experiments across three datasets and show that our method consistently outperforms baselines and is able to reconstruct a diverse set of objects. We analyze the benefits and robustness of explicit articulation conditioning and also show that this allows the hand pose estimation to further improve in test-time optimization.
研究の動機と目的
- 1枚のRGB画像から、人間の手で保持されている一般化された未確認の物体の3次元形状を再構成する課題に対処すること。
- 既知の3次元テンプレートや剛体物体の事前分布に依存する従来手法の限界を克服すること。
- 手の関節可動性を、ノイズと見なされるのではなく、物体形状推定の強力な幾何的手がかりとして活用すること。
- 遮蔽やノイズの多い手のポーズ予測が存在する状況でも、一般化性能と頑健性を向上させること。
- シミュレーションベースの変位と干渉体積を最小化することで、手のポーズと物体形状を同時に最適化するテスト時最適化を可能にすること。
提案手法
- まず、1枚のRGB画像からモデルベースの手のポーズ推定器を用いて、3次元手メッシュと関節位置を回復する。
- 物体形状を、ニューラル暗黙的ネットワークによってパラメータ化された符号付き距離関数(SDF)で表現する。
- 手のポーズから導出される関節可動性に配慮した位置符号化と、画像からの視覚特徴の両方を、暗黙的ネットワークの条件付けに用いる。
- 手中心の座標フレームを用いて入力空間を正規化することで、グローバルなポーズに対して一般化性と不変性を向上させる。
- 実際の物体形状と手のポーズを用いて、クエリポイントにおけるSDF値の予測をネットワークに学習させる。
- テスト時最適化を適用し、シミュレーションベースの変位と干渉体積を最小化することで、手のポーズと物体形状の両方を最適化する。

実験結果
リサーチクエスチョン
- RQ1手の関節可動性は、手で保持される未知の3次元物体形状を再構成するための強力で一般化可能な事前分布として機能できるか?
- RQ2ポーズパラメータ条件付けと比較して、関節可動性に配慮した位置符号化は、一般化性と頑健性においてどのように優れているか?
- RQ3予測された物体形状は、テスト時最適化によって初期の手のポーズ推定精度を向上させることができるか?
- RQ4実世界の設定において、ノイズや損傷を含む手のポーズ予測に対しても、この手法はどれほど頑健か?
- RQ5手の関節可動性に条件づけることで、特定の手のポーズや物体テンプレートへの過学習が軽減されるか?
主な発見
- 提案手法は3つのベンチマークで最先端の性能を達成し、ObManデータセットではF5スコア0.49、F10スコア0.70を記録し、ベースラインを大きく上回った。
- 関節可動性に配慮した位置符号化は、ポーズパラメータ条件付けよりも一般化性に優れており、ポーズパラメータベースラインと比較してCD誤差を28%低減した。
- 高いノイズレベル下でも手法は頑健である:手のポーズに150%のガウスノイズを加えた場合でも、ObManではF5が0.24を記録し、次に優れた手法よりも20%優れていた。
- テスト時最適化により、手のポーズ誤差(EPE)とシミュレーション変位が低減され、物体シミュレーションのずれは最適化後、8.9mmから8.7mmに減少した。
- 真値の手のポーズが与えられた場合、CD誤差は0.92、F5は0.49を達成し、理想状態下でのアーキテクチャの潜在的性能を示した。
- アブレーションスタディにより、関節可動性への明示的条件づけが性能向上に寄与することが確認され、関節可動性を含まないモデル(アブレーションモデル)はF5が0.37、ボリューム誤差が3.93にとどまった。
![Figure 3 : Visualizing reconstruction from our method and two baselines [ 31 , 37 ] on ObMan dataset from the image frame and a novel view.](https://ar5iv.labs.arxiv.org/html/2204.07153/assets/exp/obman.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。