Skip to main content
QUICK REVIEW

[논문 리뷰] Grasping Field: Learning Implicit Representations for Human Grasps

Korrawe Karunratanakul, Jinlong Yang|arXiv (Cornell University)|2020. 08. 10.
Robot Manipulation and Learning참고 문헌 89인용 수 12
한 줄 요약

이 논문은 3차원 손과 물체 간 상호작용을 모델링하기 위해 임의의 3차원 점을 손과 물체 표면으로부터의 부호 거리를 매핑하는 딥러닝 기반의 암묵적 표현인 Grasping Field를 소개한다. 이 방법은 3차원 물체 포인트 클라우드로부터 고품질의 물리적으로 타당한 인간의 움켜쥠을 생성하고, 단일 RGB 이미지에서 3차원 손과 물체 재구성을 향상시켜 이전의 최상위 기법들보다 접촉 타당성과 재구성 품질에서 뛰어난 성능을 발휘한다.

ABSTRACT

Robotic grasping of house-hold objects has made remarkable progress in recent years. Yet, human grasps are still difficult to synthesize realistically. There are several key reasons: (1) the human hand has many degrees of freedom (more than robotic manipulators); (2) the synthesized hand should conform to the surface of the object; and (3) it should interact with the object in a semantically and physically plausible manner. To make progress in this direction, we draw inspiration from the recent progress on learning-based implicit representations for 3D object reconstruction. Specifically, we propose an expressive representation for human grasp modelling that is efficient and easy to integrate with deep neural networks. Our insight is that every point in a three-dimensional space can be characterized by the signed distances to the surface of the hand and the object, respectively. Consequently, the hand, the object, and the contact area can be represented by implicit surfaces in a common space, in which the proximity between the hand and the object can be modelled explicitly. We name this 3D to 2D mapping as Grasping Field, parameterize it with a deep neural network, and learn it from data. We demonstrate that the proposed grasping field is an effective and expressive representation for human grasp generation. Specifically, our generative model is able to synthesize high-quality human grasps, given only on a 3D object point cloud. The extensive experiments demonstrate that our generative model compares favorably with a strong baseline and approaches the level of natural human grasps. Our method improves the physical plausibility of the hand-object contact reconstruction and achieves comparable performance for 3D hand reconstruction compared to state-of-the-art methods.

연구 동기 및 목표

  • 복잡한 인간 손-물체 상호작용을 모델링하기 위한 표현력 있고 효율적인 표현 개발.
  • 미리보기 없는 3차원 물체 포인트 클라우드로부터 현실적이고 물리적으로 타당한 인간의 움켜쥠 생성 가능.
  • 손과 물체 간의 물리적 제약(예: 상호관류 금지)을 강제하여 단일 RGB 이미지에서 3차원 손과 물체 재구성 향상.
  • 고정된 접촉 영역과 종수 제약을 가지는 메쉬 기반 표현의 한계 해결.
  • 암묵적이고 미분 가능한 접촉 모델링을 통해 손-물체 상호작용의 엔드 투 엔드 학습 촉진.

제안 방법

  • Grasping Field는 각 3차원 점이 손과 물체 표면으로부터의 부호 거리를 매핑하는 3차원에서 2차원으로의 매핑으로 정의된다.
  • 이 표현은 실제 인간 움켜쥠 데이터에 대해 엔드 투 엔드로 훈련된 딥 네ural 네트워크로 파arameter화된다.
  • 두 부호 거리 모두 근처에 0일 때 접촉 영역이 암묵적으로 정의되며, 자연스러운 손-물체 접촉 모델링이 가능하다.
  • 손과 물체의 부호 거리를 동시에 예측하기 위해 이중 디코더 네트워크 아키텍처를 사용하며, 물리적 타당성을 강제하는 손실 항목이 포함된다.
  • 훈련 중에 상호관류를 최소화하고 접촉의 현실감을 향상시키기 위해 접촉 및 상호관류 손실 항목을 모델에 통합한다.
  • RGB 이미지에서의 재구성에 대해서는 네트워크가 Grasping Field를 암묵적 형태의 형태 표현으로 사용하여 손과 물체 기하 구조를 동시에 예측하도록 적응시켰다.

실험 결과

연구 질문

  • RQ1학습된 암묵적 표현이 인간 손과 3차원 물체 간의 복잡하고 고차원 자유도를 가진 상호작용을 효과적으로 모델링할 수 있는가?
  • RQ2명시적인 메쉬화나 히우리스틱 접촉 영역 없이도 합성된 인간의 움켜쥠에서 물리적 타당성과 의미론적 현실감을 어떻게 강제할 수 있는가?
  • RQ3Grasping Field 표현이 메쉬 기반 기준선에 비해 단일 RGB 이미지에서 3차원 손과 물체 재구성 성능을 향상시킬 수 있는가?
  • RQ4움켜쥠 생성 과정에서 모델이 새로운 물체에 얼마나 잘 일반화되는가?
  • RQ5정확도와 견고성 측면에서 Grasping Field의 암묵적 접촉 모델링은 명시적 메쉬 기반 접촉 추론에 비해 어떻게 비교되는가?

주요 결과

  • 제안된 생성 모델은 3차원 물체 포인트 클라우드로부터 조작이 가능한 물리적·의미론적으로 타당한 인간의 움켜쥠을 고품질로 합성하며, 새로운 물체에 대해서도 성능을 발휘한다.
  • 기본 모델 [29] 대비 재구성 과제에서 손과 물체 간 상호관류를 30% 감소시켜 물리적 타당성을 크게 향상시켰다.
  • FHB 데이터셋에서 가짜 진짜 손 모델(MANO) 관절을 기준으로 평가했을 때 수동 관절 재구성 오차가 2.6cm를 기록하여 최신 기술 수준에 근접한 성능를 달성했다.
  • Grasping Field 표현은 사전 정의된 접촉 영역이나 메쉬 해상도 제약 없이도 정확한 접촉 영역 추론이 가능하게 한다.
  • 재구성된 손에 대해 MANO 피팅을 수행한 결과, 통계적 손 모델을 정규화로 사용하지 않고도 현실적인 손 자세를 생성하는 것을 확인했다.
  • 제거 실험을 통해 접촉 및 상호관류 손실 항목이 특히 이중 디코더 아키텍처에서 재구성 품질 향상에 크게 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.