Skip to main content
QUICK REVIEW

[論文レビュー] NASA: Neural Articulated Shape Approximation

Boyang Deng, JP Lewis|arXiv (Cornell University)|Dec 6, 2019
3D Shape Modeling and Analysis参考文献 62被引用数 20
ひとこと要約

ナサは、部位ごとの局所座標フレームを活用して変形をモデル化することで、一般化性能を向上させるポーズ条件付き占有関数を用いた、可動する3D形状のニューラルインプリシット表現を導入した。これは微分可能で定数時間の占有クエリを可能にし、最小限のコードでメッシュベースのモデルと同等のトラッキング性能を達成する。

ABSTRACT

Efficient representation of articulated objects such as human bodies is an important problem in computer vision and graphics. To efficiently simulate deformation, existing approaches represent 3D objects using polygonal meshes and deform them using skinning techniques. This paper introduces neural articulated shape approximation (NASA), an alternative framework that enables efficient representation of articulated deformable objects using neural indicator functions that are conditioned on pose. Occupancy testing using NASA is straightforward, circumventing the complexity of meshes and the issue of water-tightness. We demonstrate the effectiveness of NASA for 3D tracking applications, and discuss other potential extensions.

研究の動機と目的

  • 可動する可塑的物体(例:人体)を、微分可能で連続的かつ効率的な方法で表現することに挑戦する。
  • メッシュベースの表現の限界(剛体性、トポロジー制約、空間クエリ用の複雑な加速構造)を克服すること。
  • メッシュ変換や動的空間データ構造に依存せずに、直接的かつ微分可能な占有クエリを可能にすること。
  • 部位ごとの局所的剛性を活用することで、構造的なニューラルアーキテクチャにより、未観測ポーズへの一般化を向上させること。
  • 距離関数の計算を回避するインプリシット占有テンプレートを用いて、3Dトラッキングタスクにおける表現の有効性を示すこと。

提案手法

  • ポーズパラメータに条件付けられたニューラルインジケータ(占有)関数を用い、物体内部では1、外部では0を出力する3D可動形状を表現する。
  • 形状を身体部位に分解し、それぞれに固有の局所座標フレームと学習可能なニューラル占有関数を割り当てる。
  • 全ポーズから局所的変形パラメータへのマッピングを可能にする部位ごとのポーズエンコーダを用い、局所的な非剛性変形のモデリングを実現する。
  • 部位固有の占有関数を微分可能で合成するメカニズムを用いて、全物体の占有状態を再構築する。
  • メッシュ走査や加速構造を回避することで、NVIDIA GTX 1080で1クエリあたり0.06 msという定数時間の占有クエリを実現する。
  • 距離関数の計算を回避する占有モデルに基づき、最尤推定を用いてポーズを最適化することで3Dトラッキングに応用する。

実験結果

リサーチクエスチョン

  • RQ1構造のないポーズ条件付きモデルに比べ、神経インプリシット表現が可動3D変形をより良い一般化性能で効果的にモデル化できるか?
  • RQ2部位ごとの局所座標フレームをインダクティブバイアスとして組み込むことで、可動形状表現の学習と一般化が向上するか?
  • RQ3微分可能な占有クエリを用いることで、古典的な3Dトラッキングパイプラインの簡素化と高速化が可能か?
  • RQ4距離関数の計算を回避するニューラル占有ベースのトラッカーは、メッシュベースのベースラインと比較して、精度と実装の複雑さの両面で優れているか?
  • RQ5明示的なメッシュの監視や幾何的制約なしに、神経インプリシットモデルが複雑な可動運動をどの程度正確に捉えることができるか?

主な発見

  • NASAは、DFaustの'ハード'シーケンスで平均インターセクションオーバーユニオン(mIoU)0.948を達成し、以前の幾何学的学習手法を上回り、メッシュベースのモデルに近い性能を示した。
  • NASAの'ハード'シーケンスにおけるチャームファーライ1誤差は0.00006であり、構造のないモデルの0.00700に比べ顕著に低く、再構築の忠実度が優れていることを示している。
  • NVIDIA GTX 1080で1クエリあたり0.06 msという定数時間の占有クエリを実現し、加速データ構造の必要性がなくなる。
  • 微分可能な占有モデルにより、3Dトラッキングが数行のコードで実現可能となり、従来のメッシュベースのトラッキングパイプラインに比べて著しく簡素化された。
  • NASAは構造のないモデルに比べ、未観測ポーズへの一般化性能が優れており、同じタスクでmIoUが49%低下する一方で、構造のないモデルでは49%の性能低下を示した。
  • この手法はグローバルな形状と変形パターンを効果的に捉えているが、顔の特徴のような高周波数の幾何的詳細にはまだ苦労しており、高度なインプリシット表現技術の導入によりさらなる改善の余地がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。