Skip to main content
QUICK REVIEW

[논문 리뷰] HandNeRF: Neural Radiance Fields for Animatable Interacting Hands

Zhiyang Guo, Wengang Zhou|arXiv (Cornell University)|2023. 03. 24.
Human Pose and Action Recognition인용 수 4
한 줄 요약

HandNeRF는 다양한 자세에서 단일 또는 상호작용하는 손의 고해상도, 사진처럼 사실적인 재구성과 새로운 시점 합성을 위한 통합된 신경 렌디언스 필드 프레임워크를 제안한다. 자세에 따라 변형되는 변형 필드를 활용해 표준 공간으로 매핑하고, 깊이 유도 밀도 최적화 및 신경 특징 증류를 통해 InterHand2.6M 데이터셋에서 기존 최고 성능을 달성하며 기하학적 형태, 질감 및 가림 처리 능력이 향상된다.

ABSTRACT

We propose a novel framework to reconstruct accurate appearance and geometry with neural radiance fields (NeRF) for interacting hands, enabling the rendering of photo-realistic images and videos for gesture animation from arbitrary views. Given multi-view images of a single hand or interacting hands, an off-the-shelf skeleton estimator is first employed to parameterize the hand poses. Then we design a pose-driven deformation field to establish correspondence from those different poses to a shared canonical space, where a pose-disentangled NeRF for one hand is optimized. Such unified modeling efficiently complements the geometry and texture cues in rarely-observed areas for both hands. Meanwhile, we further leverage the pose priors to generate pseudo depth maps as guidance for occlusion-aware density learning. Moreover, a neural feature distillation method is proposed to achieve cross-domain alignment for color optimization. We conduct extensive experiments to verify the merits of our proposed HandNeRF and report a series of state-of-the-art results both qualitatively and quantitatively on the large-scale InterHand2.6M dataset.

연구 동기 및 목표

  • 복잡한 자가가림과 제한된 시야 범위를 가진 상호작용하는 손의 정확하고 사진처럼 사실적인 기하학적 형태와 외관을 재구성하는 데 도전하는 것.
  • 제스처 애니메이션 및 가상 현실 응용 분야를 위한 고해상도의 새로운 시점 및 새로운 자세 합성을 가능하게 하는 것.
  • 자세 인식 변형과 교차 도메인 특징 정렬을 사용해 단일 손과 상호작용하는 손 모델링을 하나의 NeRF 기반 프레임워크 안에서 통합하는 것.
  • 전통적인 메쉬 기반 모델이 고주파 세부 정보를 포착하거나 손의 상호작용에서 가려진 영역을 처리하는 데 한계를 보이는 것을 극복하는 것.
  • 깊이 감독과 2D 교사 네트워크로부터의 신경 특징 증류를 통해 밀도 예측 및 질감 학습의 강건성을 향상시키는 것.

제안 방법

  • 자세 조건에 따라 변형되는 변형 필드가 다양한 손 자세에서 레이를 공통의 표준 공간으로 변형시켜 통합된 NeRF 최적화를 가능하게 한다.
  • 학습 가능한 오차 보정 네트워크가 표준 블렌드 스킨닝을 초월해 비탄성 변형 모델링을 향상시킨다.
  • 인간 자세 사전 지식에서 유도된 가짜 깊이 맵을 사용해 가림을 고려한 밀도 학습을 유도하고 기하학적 정확도를 향상시킨다.
  • 신경 특징 증류를 통해 사전에 훈련된 2D 교사 네트워크의 특징을 3D 색상 필드와 정렬시켜 질감 품질을 향상시키고 잡음 감소를 달성한다.
  • 공통의 표준 NeRF가 모든 자세에서 기하학적 형태와 외관을 모델링하며, 다중 시점 일致성 있는 볼륨 렌더링을 통해 새로운 시점 합성을 가능하게 한다.
  • 통합된 레이 조합 및 매핑 전략을 통해 단일 손과 두 손이 상호작용하는 시나리오 모두를 지원한다.

실험 결과

연구 질문

  • RQ1통합된 NeRF 프레임워크가 다양한 자세에서 높은 기하학적 및 질감 정확도로 단일 손과 상호작용하는 손을 효과적으로 모델링할 수 있는가?
  • RQ2인간 자세 사전 지식에서 파생된 깊이 감독은 저조도 영역에서의 밀도 추정과 가림 처리를 어떻게 향상시키는가?
  • RQ32D 교사 네트워크로부터의 신경 특징 증류가 3D 손 재구성에서 질감 품질을 향상시키고 잡음을 감소시키는 데 어느 정도 기여하는가?
  • RQ4자세 기반 변형 필드는 새로운 자세와 시점에서의 일반화 및 일관성 향상에 어떻게 기여하는가?
  • RQ5깊이 감독과 특징 증류가 도전적인 손 상호작용 시나리오에서 전체 성능에 대해 각각 어떤 기여를 하는가?

주요 결과

  • 전체 파ip라인을 사용할 경우 HandNeRF는 단일 손 재구성에서 PSNR 33.0204를 달성하며, 증류 기반 아블레이션(32.8421)이나 깊이 감독 기반 아블레이션(30.1057)보다 유의미하게 높은 성능을 보였다.
  • 아블레이션 연구 결과, 깊이 감독은 깊이 오차(DE)를 0.2106에서 0.1840으로 감소시켜 새로운 시점 렌더링에서 기하학적 일관성 향상을 입증했다.
  • 신경 특징 증류를 통해 LPIPS는 0.0488(증류 없음)에서 0.0475로 감소하여 더 나은 시각적 품질과 질감의 현실감 향상을 입증했다.
  • TransRenderer 기반 신경 렌더러는 가장 낮은 LPIPS(0.0479)와 DE(0.1364)를 기록해 세부 정보 보존과 깊이 정확도 향상을 입증했다.
  • 모델은 대규모 InterHand2.6M 벤치마크에서 정성적 및 정량적으로 검증된 바, 임의의 시점에서 상호작용하는 손의 고해상도, 사진처럼 사실적인 이미지와 영상을 생성한다.
  • 프레임워크는 단일 손과 두 손이 상호작용하는 시나리오 모두와 호환되며, 다양한 상호작용 자세에서 일관되고 강건한 성능을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.