Skip to main content
QUICK REVIEW

[論文レビュー] FourierHandFlow: Neural 4D Hand Representation Using Fourier Query Flow

Ji‐Hyun Lee, Junbong Jang|arXiv (Cornell University)|Jul 16, 2023
Human Pose and Action RecognitionComputer Science被引用数 3
ひとこと要約

FourierHandFlow は、モノクロナルRGB動画から、フーリエ符号化クエリフローを用いて連続的で滑らかな時間的変形をモデル化する、新しいニューラル4次元手の表現を提案する。インクリメンタルな線形ブレンドスキンニングとクエリごとの変位を用いて、ポーズと形状のフローの固定フーリエ係数を学習することで、従来の暗黙的手法に比べて計算効率が向上した状態の4次元再構成精度を達成する。

ABSTRACT

Recent 4D shape representations model continuous temporal evolution of implicit shapes by (1) learning query flows without leveraging shape and articulation priors or (2) decoding shape occupancies separately for each time value. Thus, they do not effectively capture implicit correspondences between articulated shapes or regularize jittery temporal deformations. In this work, we present FourierHandFlow, which is a spatio-temporally continuous representation for human hands that combines a 3D occupancy field with articulation-aware query flows represented as Fourier series. Given an input RGB sequence, we aim to learn a fixed number of Fourier coefficients for each query flow to guarantee smooth and continuous temporal shape dynamics. To effectively model spatio-temporal deformations of articulated hands, we compose our 4D representation based on two types of Fourier query flow: (1) pose flow that models query dynamics influenced by hand articulation changes via implicit linear blend skinning and (2) shape flow that models query-wise displacement flow. In the experiments, our method achieves state-of-the-art results on video-based 4D reconstruction while being computationally more efficient than the existing 3D/4D implicit shape representations. We additionally show our results on motion inter- and extrapolation and texture transfer using the learned correspondences of implicit shapes. To the best of our knowledge, FourierHandFlow is the first neural 4D continuous hand representation learned from RGB videos. The code will be publicly accessible.

研究の動機と目的

  • モノクロナルRGB動画からの連続的で滑らかで効率的な4次元手再構成の欠如に対処すること。
  • ジャッキーモーション、高い計算コスト、対応関係の不良といった、既存の4次元暗黙的表現の限界を克服すること。
  • ポーズと形状に依存する変形を分離することで、暗黙的形状対応関係を用いたアーチキテクチャ的ハンドモデリングを可能にすること。
  • フーリエ級数を用いて周波数ドメインで時間的ダイナミクスを学習することで、自然に滑らかな運動を正則化すること。

提案手法

  • 本手法は、3次元占有フィールドと2種類のフーリエクエリフロー(ポーズフローと形状フロー)を組み合わせる。両者とも三角関数基底関数の固定係数によってパラメータ化される。
  • ポーズフローは、関節軌道の学習されたフーリエ係数としてモデル化され、ノイズの多いフレームごとの予測から周波数ドメインの事前分布を用いてノイズ除去される。
  • ポーズフローは、事前に訓練された暗黙的線形ブレンドスキンニング(LBS)重みフィールドを用いて各クエリポイントに伝搬され、クエリごとの運動が計算される。
  • 形状フローは、ポーズフローに対するクエリごとの変位を表すフーリエ係数として学習され、ソフト tissue 効果のような非線形変形を捉える。
  • 4次元表現全体はRGBシーケンスからエンドツーエンドで訓練され、推論時に逆フーリエ合成によりクエリフローが再構成される。
  • 本手法は、ODEを解いたり、各時間ステップごとに占有状態をデコードしたりしないため、時間的連続性を維持しつつ、高速な推論が可能である。

実験結果

リサーチクエスチョン

  • RQ1フーリエ符号化クエリフローは、モノクロナルRGB動画から、滑らかで連続的な4次元手形状ダイナミクスを効果的に正則化できるか?
  • RQ2周波数ドメインでクエリフローを学習することは、空間ドメインやODEベースの手法と比較して、再構成精度と効率性においてどのように異なるか?
  • RQ3分離されたポーズフローと形状フローのコンponentsは、時間経過にわたって暗黙的形状対応関係を保ちながら、アーチキテクチャ的ハンドジオメトリをモデル化できるか?
  • RQ4本手法は、未観測のRGB入力にどの程度一般化できるか。また、テクスチャ転送やモーション予測外挿などの下流タスクをサポートできるか?

主な発見

  • FourierHandFlow は、動画ベースの4次元手再構成において最先端の性能を達成し、InterHand2.6M THサブセットでIoU 62.8%、チェンファーディスタンス(CD)4.46 mmを達成した。
  • アブレーションスタディにより、ポーズフローと形状フローの両方が不可欠であることが確認された。両者を削除すると性能が著しく低下し(例:ポーズフローなしではIoUが50.1%に低下)、顕著な性能低下が生じた。
  • 周波数ドメインでクエリフローをモデル化することは、ODEベースや入力条件付きベースラインを上回り、1.8%高いIoUと0.4 mm低いCDを達成した。
  • 本手法は、学習された暗黙的対応関係を用いて、異なるシーケンス間でも高品質なテクスチャ転送を実現した。
  • モーション内挿・外挿の結果から、未観測の時間点においても、手形状の滑らかな時間的進化が確認され、4次元表現の連続性が裏付けられた。
  • 実世界のRGB2Hands画像への一般化は、妥当な再構成を達成し、分布シフトに対して強いロバストネスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。