Skip to main content
QUICK REVIEW

[논문 리뷰] GOAL: Generating 4D Whole-Body Motion for Hand-Object Grasping

Omid Taheri, Vasileios Choutas|arXiv (Cornell University)|2021. 12. 21.
Human Pose and Action Recognition인용 수 8
한 줄 요약

GOAL는 가상 아바타가 생소한 3D 물체를 잡는 동안 전신, 머리, 손, 물체 간의 상호작용을 동시에 모델링하는 최초의 방법이다. 두 개의 네트워크를 사용한다: GNet은 접촉이 있는 실제적인 목표 그립을 예측하고, MNet은 시작 자세에서 그립까지의 부드럽고 물리적으로 타당한 운동 시퀀스를 생성한다. 이로 인해 정량적 지표와 인지 평가 모두에서 최신 기술 수준의 현실감을 달성한다.

ABSTRACT

Generating digital humans that move realistically has many applications and is widely studied, but existing methods focus on the major limbs of the body, ignoring the hands and head. Hands have been separately studied, but the focus has been on generating realistic static grasps of objects. To synthesize virtual characters that interact with the world, we need to generate full-body motions and realistic hand grasps simultaneously. Both sub-problems are challenging on their own and, together, the state-space of poses is significantly larger, the scales of hand and body motions differ, and the whole-body posture and the hand grasp must agree, satisfy physical constraints, and be plausible. Additionally, the head is involved because the avatar must look at the object to interact with it. For the first time, we address the problem of generating full-body, hand and head motions of an avatar grasping an unknown object. As input, our method, called GOAL, takes a 3D object, its position, and a starting 3D body pose and shape. GOAL outputs a sequence of whole-body poses using two novel networks. First, GNet generates a goal whole-body grasp with a realistic body, head, arm, and hand pose, as well as hand-object contact. Second, MNet generates the motion between the starting and goal pose. This is challenging, as it requires the avatar to walk towards the object with foot-ground contact, orient the head towards it, reach out, and grasp it with a realistic hand pose and hand-object contact. To achieve this, the networks exploit a representation that combines SMPL-X body parameters and 3D vertex offsets. We train and evaluate GOAL, both qualitatively and quantitatively, on the GRAB dataset. Results show that GOAL generalizes well to unseen objects, outperforming baselines. GOAL takes a step towards synthesizing realistic full-body object grasping.

연구 동기 및 목표

  • 가상 아바타가 전신, 머리, 손, 물체 간의 상호작용을 동시에 생성할 수 있는 방법의 부족을 해결하기 위해.
  • 걷기, 머리 방향, 민감한 손 자세를 포함하여, 그립 과정에서 신체, 머리, 손, 물체 간의 복잡한 조율을 모델링하기 위해.
  • 생소한 3D 물체에 대해 발-지면 접촉과 현실적인 손-물체 접촉을 포함한 물리적으로 타당한 운동을 생성하기 위해.
  • 3D 물체, 위치, 초기 신체 자세로부터 종단 간 전면 운동 시퀀스를 생성할 수 있도록 하기 위해.
  • 최적화를 통해 개선된 SMPL-X 파라미터와 3D 정점 오프셋을 조합한 새로운 표현 방식을 통해 현실감을 향상시키기 위해.

제안 방법

  • GNet은 조건부 변동 자동차오더(conditional variational autoencoder, cVAE)로, 현실적인 신체, 머리, 팔, 손 자세와 손-물체 접촉을 포함한 목표 전신 그립을 예측한다.
  • MNet은 초기 자세에서 목표 자세 사이의 운동을 자동재귀적으로 생성하며, 발-지면 접촉과 머리 방향을 모델링한다.
  • 두 네트워크 모두 유클리드 공간에서 3D 정점 오프셋을 회귀하여, SMPL-X 신체 변형을 정밀하게 보정하고 자세 정확도를 향상시킨다.
  • 오프라인 최적화 단계를 통해 예측된 SMPL-X 파라미터와 정점 오프셋을 보정하여 물리적 타당성과 접촉의 현실감을 향상시킨다.
  • 모델은 SMPL-X를 신체 표현으로 사용하여 전신 및 손 기하학을 세밀하게 모델링할 수 있다.
  • 학습 및 평가는 GRAB 데이터셋에서 수행되었으며, 운동의 현실감에 대한 정량적 및 인지 평가가 이루어졌다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 생소한 3D 물체를 그립하기 위해 손, 머리, 신체의 조율된 운동을 포함한 현실적인 4D 전신 운동을 생성할 수 있는가?
  • RQ2발-지면 접촉과 물체 향한 머리 방향을 포함하여, 전신 운동 생성을 어떻게 물리적으로 타당하게 만들 수 있는가?
  • RQ3SMPL-X 파라미터와 3D 정점 오프셋의 공동 표현 방식이 생성된 그립과 운동의 현실감 및 정확도를 향상시킬 수 있는가?
  • RQ4학습 중에 보지 못한 신규 물체에 대해 모델의 일반화 능력은 어떠한가?
  • RQ5인지 평가에서 생성된 운동이 실제 인간 운동의 현실감과 얼마나 유사한가?

주요 결과

  • 운동의 현실감에 대해 인간 평가에서 평균 인지 평점이 5점 만점에 3.79점으로, 참조값(4.22점)에 근접하여 강력한 현실감을 보였다.
  • 참가자들에 의한 최종 손-물체 그립 평점은 5점 만점에 3.66점으로, 기준 모델 대비 그립 품질과 접촉의 현실감에서 뚜렷한 우월성을 보였다.
  • 발-지면 접촉의 현실감 평점은 5점 만점에 3.88점이며, 13.7%의 프레임에서 발이 미끄러지는 경우가 있었고, 이는 양호한 물리적 타당성을 의미한다.
  • MNet의 출력 프레임 수를 늘일수록 자세 오차가 감소한다: 출력 프레임 수가 1에서 10으로 증가함에 따라 V2V 신체 오차는 14.70에서 9.34로 감소했다.
  • 모델은 생소한 물체에 대해 잘 일반화되며, 훈련 세트에 포함되지 않은 신규 물체에 대해서도 MNet이 안정적이고 수렴하는 운동을 생성했다.
  • 제거 실험 결과, MNet 단계당 더 많은 운동 프레임을 생성할수록 정확도와 수렴성이 향상되어 손이 물체에서 벗어나는 것을 방지함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.