Skip to main content
QUICK REVIEW

[논문 리뷰] FourierHandFlow: Neural 4D Hand Representation Using Fourier Query Flow

Ji‐Hyun Lee, Junbong Jang|arXiv (Cornell University)|2023. 07. 16.
Human Pose and Action RecognitionComputer Science인용 수 3
한 줄 요약

FourierHandFlow는 단일 RGB 영상에서 인체 손의 연속적이고 부드러운 시간적 변형을 푸리에 인코딩된 쿼리 플로우를 사용하여 모델링하는 새로운 신경 4차원 손 표현을 제안한다. 암시적 선형 블렌드 스킨닝과 쿼리별 이동량을 통해 자세 및 형태 플로우에 대한 고정된 푸리에 계수를 학습함으로써, 이전의 암시적 방법들보다 더 높은 계산 효율성을 확보하면서도 최신 기술 수준의 4차원 재구성 정확도를 달성한다.

ABSTRACT

Recent 4D shape representations model continuous temporal evolution of implicit shapes by (1) learning query flows without leveraging shape and articulation priors or (2) decoding shape occupancies separately for each time value. Thus, they do not effectively capture implicit correspondences between articulated shapes or regularize jittery temporal deformations. In this work, we present FourierHandFlow, which is a spatio-temporally continuous representation for human hands that combines a 3D occupancy field with articulation-aware query flows represented as Fourier series. Given an input RGB sequence, we aim to learn a fixed number of Fourier coefficients for each query flow to guarantee smooth and continuous temporal shape dynamics. To effectively model spatio-temporal deformations of articulated hands, we compose our 4D representation based on two types of Fourier query flow: (1) pose flow that models query dynamics influenced by hand articulation changes via implicit linear blend skinning and (2) shape flow that models query-wise displacement flow. In the experiments, our method achieves state-of-the-art results on video-based 4D reconstruction while being computationally more efficient than the existing 3D/4D implicit shape representations. We additionally show our results on motion inter- and extrapolation and texture transfer using the learned correspondences of implicit shapes. To the best of our knowledge, FourierHandFlow is the first neural 4D continuous hand representation learned from RGB videos. The code will be publicly accessible.

연구 동기 및 목표

  • 단일 RGB 영상에서 연속적이고 부드럽고 효율적인 4차원 손 재구성의 부족을 해결하기 위해.
  • 기존의 4차원 암시적 표현에서의 한계, 예를 들어 떨림 있는 운동, 높은 계산 비용, 부정확한 대응 모델링 문제를 해결하기 위해.
  • 자세와 형태에 의존하는 변형을 분리함으로써 암시적 형태 대응 관계를 유지하면서 체계적인 손 모델링을 가능하게 하기 위해.
  • 푸리에 급수를 사용하여 주파수 도메인에서 시간 동적 특성을 학습함으로써 자연스럽게 부드러운 운동을 정규화하기 위해.

제안 방법

  • 이 방법은 3차원 점유도 필드와 두 가지 유형의 푸리에 쿼리 플로우(자세 플로우 및 형태 플로우)를 결합하며, 모두 삼각함수 기저 함수의 고정 계수로 매개변수화된다.
  • 자세 플로우는 관절 궤적의 학습된 푸리에 계수를 통해 모델링되며, 주파수 도메인의 사전 지식을 활용해 노이즈가 많은 프레임별 예측에서 노이즈를 제거한다.
  • 자세 플로우는 사전에 학습된 암시적 선형 블렌드 스킨닝(LBS) 가중치 필드를 사용하여 각 쿼리 포인트로 전파되어 쿼리별 운동을 계산한다.
  • 형태 플로우는 자세 플로우에 대한 쿼리별 이동량을 나타내는 푸리에 계수로 학습되며, 연조직 효과와 같은 비선형 변형을 포착한다.
  • 전체 4차원 표현은 RGB 시퀀스로부터 엔드 투 엔드로 훈련되며, 추론 시에는 역 푸리에 합성으로 쿼리 플로우를 재구성한다.
  • 이 방법은 ODE를 풀거나 각 시간 단계마다 점유도를 복호화하는 것을 피함으로써 더 빠른 추론을 가능하게 하면서도 시간 연속성을 유지한다.

실험 결과

연구 질문

  • RQ1푸리에 인코딩된 쿼리 플로우는 단일 RGB 영상에서 4차원 손 형태의 동적 특성을 효과적으로 부드럽고 연속적으로 정규화할 수 있는가?
  • RQ2주파수 도메인에서 쿼리 플로우를 학습하는 것이 공간 도메인 또는 ODE 기반 접근법에 비해 재구성 정확도와 효율성 측면에서 어떻게 비교되는가?
  • RQ3분리된 자세 플로우 및 형태 플로우 구성 요소는 시간에 걸쳐 암시적 형태 대응 관계를 유지하면서도 체계적인 손 기하학을 모델링할 수 있는가?
  • RQ4이 방법은 예측되지 않은 RGB 입력으로 일반화되며, 텍스처 전이 및 운동 외삽과 같은 후속 작업을 지원할 정도로 얼마나 잘 작동하는가?

주요 결과

  • FourierHandFlow는 영상 기반 4차원 손 재구성에서 최신 기술 수준의 성능을 달성하였으며, InterHand2.6M TH 서브셋에서 IoU 62.8% 및 카메프 거리 4.46 mm를 기록하였다.
  • 절단 실험을 통해 자세 플로우 및 형태 플로우 모두 필수적임을 확인하였으며, 둘 중 하나를 제거할 경우 성능 저하가 심각하게 발생한다(예: 자세 플로우 없이 IoU가 50.1%로 감소).
  • 주파수 도메인에서 쿼리 플로우를 모델링하는 것이 ODE 기반 및 입력 조건 기반 베이스라인보다 우수하며, 다음으로 우수한 변종보다 IoU가 1.8%p 높고 CD는 0.4 mm 낮다.
  • 학습된 암시적 대응 관계를 활용하여, 서로 다른 시퀀스 간에도 고품질의 텍스처 전이를 실현할 수 있다.
  • 운동 내외삽 결과는 예측되지 않은 시간 포인트에서 손 형태의 부드러운 시간적 변화를 보여주며, 4차원 표현의 연속성을 검증한다.
  • 실제 RGB2Hands 이미지에 대한 일반화는 타당한 재구성을 제공함으로써 분포 이탈에 대한 강건성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.