Skip to main content
QUICK REVIEW

[논문 리뷰] What's in your hands? 3D Reconstruction of Generic Objects in Hands

Yufei Ye, Abhinav Gupta|arXiv (Cornell University)|2022. 04. 14.
Human Pose and Action Recognition인용 수 7
한 줄 요약

이 논문은 단일 RGB 이미지에서 인간의 손에 쥐어진 일반적인, 알려지지 않은 물체의 3D 재구성을 위한 새로운 방법을 제안한다. 이 방법은 손의 운동가능성에 민감한 손 자세를 조건부 사전 조건으로 활용한다. 시각적 특징과 손 중심 좌표계를 조건으로 하는 암묵적 신경망을 사용함으로써, 다양한 데이터셋에서 최신 기술 수준의 성능을 달성하며, 기존의 기준보다 크게 뛰어나며, 테스트 시점 보정을 통해 물체와 손 자세 정확도를 향상시킨다.

ABSTRACT

Our work aims to reconstruct hand-held objects given a single RGB image. In contrast to prior works that typically assume known 3D templates and reduce the problem to 3D pose estimation, our work reconstructs generic hand-held object without knowing their 3D templates. Our key insight is that hand articulation is highly predictive of the object shape, and we propose an approach that conditionally reconstructs the object based on the articulation and the visual input. Given an image depicting a hand-held object, we first use off-the-shelf systems to estimate the underlying hand pose and then infer the object shape in a normalized hand-centric coordinate frame. We parameterized the object by signed distance which are inferred by an implicit network which leverages the information from both visual feature and articulation-aware coordinates to process a query point. We perform experiments across three datasets and show that our method consistently outperforms baselines and is able to reconstruct a diverse set of objects. We analyze the benefits and robustness of explicit articulation conditioning and also show that this allows the hand pose estimation to further improve in test-time optimization.

연구 동기 및 목표

  • 단일 RGB 이미지에서 인간의 손에 쥐어진 일반적인, 알려지지 않은 물체의 3D 형태를 재구성하는 문제를 해결하기 위해.
  • 기존의 방법이 알려진 3D 템플릿이나 강체 물체 사전 조건에 의존하는 한계를 극복하기 위해.
  • 손의 운동가용성을 소음이 아니라 강력한 기하학적 단서로 활용하여 물체 형태 추론을 유도하기 위해.
  • 가림과 노이즈가 있는 손 자세 예측 상황에서도 일반화 능력과 강인성을 향상시키기 위해.
  • 손 자세와 물체 형태를 동시에 최적화하여 상호작용의 현실감을 높이는 테스트 시점 보정을 가능하게 하기 위해.

제안 방법

  • 단일 RGB 이미지에서 3D 손 메쉬와 관절 위치를 복원하기 위해 사전에 확보된 모델 기반 손 자세 추정기 사용.
  • 신경 암묵적 네트워크로 매개변수화된 서피스 거리 함수(SDF)를 사용해 물체 형태를 표현.
  • 손 자세에서 유도된 운동가용성에 민감한 위치 인코딩과 함께 영상의 시각적 특징을 조건으로 하는 암묵적 네트워크 사용.
  • 손 중심 좌표계를 사용해 입력 공간을 정규화함으로써 전반적인 일반화 능력과 전역 자세에 대한 불변성을 향상.
  • 지표 물체 형태와 손 자세를 기반으로 쿼리 포인트에서의 SDF 값을 예측하도록 네트워크 학습.
  • 모의 시뮬레이션 기반 이동 거리와 교차 부피를 최소화함으로써 테스트 시점 최적화를 적용해 손 자세와 물체 형태를 동시에 보정.
Figure 2 : Given an image of a hand-held object, we first use an off-the-shelf system to estimate hand articulation $\theta_{A}$ and the camera pose $\pi_{w}$ . With the predicted articulated hand along with the image, the object shape is reconstructed by an implicit network. For each query point $\
Figure 2 : Given an image of a hand-held object, we first use an off-the-shelf system to estimate hand articulation $\theta_{A}$ and the camera pose $\pi_{w}$ . With the predicted articulated hand along with the image, the object shape is reconstructed by an implicit network. For each query point $\

실험 결과

연구 질문

  • RQ1손의 운동가용성은 손에 쥐어진 상호작용에서 알려지지 않은 3D 물체 형태 재구성에 강력하고 일반화 가능한 사전 조건으로 기능할 수 있는가?
  • RQ2자세 매개변수 조건부 조건과 비교할 때, 운동가용성에 민감한 위치 인코딩은 일반화 능력과 강인성 측면에서 어떻게 성능을 발휘하는가?
  • RQ3예측된 물체 형태는 테스트 시점 보정을 통해 초기 손 자세 추정 정확도 향상에 기여할 수 있는가?
  • RQ4실세계 환경에서 손 자세 예측에 노이즈나 손상이 있을 경우 이 방법은 얼마나 강인한가?
  • RQ5손의 운동가용성에 기반한 조건부 조건은 특정 손 자세나 물체 템플릿에 대한 과적합을 줄이는가?

주요 결과

  • 제안된 방법은 세 가지 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, ObMan 데이터셋에서 F5 점수 0.49와 F10 점수 0.70을 기록하여 기준 방법보다 크게 뛰어났다.
  • 운동가용성에 민감한 위치 인코딩은 자세 매개변수 조건부 조건보다 더 우수한 일반화 능력을 보였으며, 자세 매개변수 기반 기준 방법 대비 거리 오차(CD 오차)를 28% 감소시켰다.
  • 높은 노이즈 수준에서도 강인성을 유지했다: 손 자세에 150%의 가우시안 노이즈가 가해진 상황에서 ObMan에서 F5 점수 0.24를 기록하였으며, 다음으로 우수한 방법보다 20% 높은 성능을 보였다.
  • 테스트 시점 보정은 손 자세 오차(EPE)와 모의 시뮬레이션 이동 거리를 감소시켰으며, 물체 모의 슬립 거리는 보정 후 8.9mm에서 8.7mm로 감소했다.
  • 정답 손 자세가 제공된 경우, 이 방법은 CD 오차 0.92와 F5 점수 0.49를 기록하여 이상적인 조건에서 아키텍처의 잠재력을 입증했다.
  • 절단 실험을 통해 명시적인 운동가용성 조건부 조건이 성능 향상에 기여하는 것으로 확인되었으며, 운동가용성 조건부 조건이 제거된 모델은 F5 점수 0.37과 부피 오차 3.93을 기록했다.
Figure 3 : Visualizing reconstruction from our method and two baselines [ 31 , 37 ] on ObMan dataset from the image frame and a novel view.
Figure 3 : Visualizing reconstruction from our method and two baselines [ 31 , 37 ] on ObMan dataset from the image frame and a novel view.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.