[논문 리뷰] GRIP: Generating Interaction Poses Using Spatial Cues and Latent Consistency
GRIP는 노이즈가 있는 3D 신체 및 물체 운동에서 실재감 있고 시간적으로 일관된 손-물체 상호작용 자세를 생성하는 학습 기반 방법이다. 이는 정제된 팔 운동, 새로운 거리 기반 손 센서(주변 및 근접 센서), 잠재 공간 시간 일관성과 함께 이중 단계 추론 파이프라인을 사용하여 단일 및 双손 잡기의 역동적이고 침투가 없는 손 자세를 합성한다. 이는 새로운 물체와 데이터셋에 대해 일반화 능력과 현실감에서 기존 방법들을 능가한다.
Hands are dexterous and highly versatile manipulators that are central to how humans interact with objects and their environment. Consequently, modeling realistic hand-object interactions, including the subtle motion of individual fingers, is critical for applications in computer graphics, computer vision, and mixed reality. Prior work on capturing and modeling humans interacting with objects in 3D focuses on the body and object motion, often ignoring hand pose. In contrast, we introduce GRIP, a learning-based method that takes, as input, the 3D motion of the body and the object, and synthesizes realistic motion for both hands before, during, and after object interaction. As a preliminary step before synthesizing the hand motion, we first use a network, ANet, to denoise the arm motion. Then, we leverage the spatio-temporal relationship between the body and the object to extract two types of novel temporal interaction cues, and use them in a two-stage inference pipeline to generate the hand motion. In the first stage, we introduce a new approach to enforce motion temporal consistency in the latent space (LTC), and generate consistent interaction motions. In the second stage, GRIP generates refined hand poses to avoid hand-object penetrations. Given sequences of noisy body and object motion, GRIP upgrades them to include hand-object interaction. Quantitative experiments and perceptual studies demonstrate that GRIP outperforms baseline methods and generalizes to unseen objects and motions from different motion-capture datasets.
연구 동기 및 목표
- 손 데이터가 누락되거나 노이즈가 있는 경우에도 3D 인간-물체 상호작용 애니메이션에서 현실적이고 역동적인 손 운동의 부족을 해결하기 위해.
- 사전 잡기, 잡기, 후속 잡기 단계 동안 시간적으로 일관되고 물리적으로 타당한 손 자세를 자동으로 합성하기 위해.
- 손 전용 애너테이션을 요구하지 않고 다양한 물체 형태, 크기 및 운동 유형으로 일반화하기 위해.
- 반복 최적화를 피함으로써 실시간 추론을 달성하여 애니메이션 및 XR 파이프라인에 실용적으로 구현하기 위해.
- 기존 동작 캡처 데이터셋을 손 데이터 재기록 없이도 정확하고 자연스러운 손 상호작용으로 업그레이드하기 위해.
제안 방법
- 노이즈가 있는 신체 및 물체 시퀀스에서 팔 운동을 정제하기 위해 ANet라는 노이즈 제거 네트워크를 사용한다.
- 두 가지 새로운 가상 손 센서를 도입한다: 주변 센서는 손의 광범위한 접근 범위 내에서 물체의 형태와 운동을 캡처하고, 근접 센서는 손과 물체 표면 간의 세밀한 기하학적 및 거리 특징을 인코딩한다.
- 이중 단계 추론 파이프라인을 적용한다: 첫 번째로, 공간-시간 단서를 사용하여 잠재 공간에서 시간적으로 일관된 손 자세를 생성하는 일관성 네트워크(CNet)를 사용한다.
- 두 번째로, 근접 특징을 재계산하고 손-물체 침투를 줄임으로써 자세 정확도를 향상시키는 보완 네트워크(RNet)를 사용한다.
- CNet에서 잠재 공간 시간 일관성(LTC)을 강제하여 프레임 간 부드럽고 자연스러운 운동 전환을 보장한다.
- 다양한 데이터셋(GRAB, InterCap)에서 학습 및 평가되며, 예측 불가능한 물체와 운동 유형에 대한 일반화도 테스트된다.
실험 결과
연구 질문
- RQ1손 애너테이션을 요구하지 않고도, 단지 신체 및 물체 운동만으로 학습 기반 방법이 현실적이고 역동적인 손-물체 상호작용 자세를 생성할 수 있는가?
- RQ2손, 신체, 물체 간의 공간-시간 상호작용 단서를 효과적으로 모델링하여 손 자세 생성을 안내할 수 있는가?
- RQ3잠재 공간 시간 일관성이 후행 스무딩 처리와 비교해 생성된 손 운동의 현실감과 부드러움을 향상시킬 수 있는가?
- RQ4모델이 새로운 물체 형태와 다른 데이터셋의 새로운 운동 시퀀스에 얼마나 잘 일반화되는가?
- RQ5실시간 성능와 높은 시간 일관성을 유지하면서도 손-물체 침투를 줄일 수 있는가?
주요 결과
- GRIP는 침투 부피를 2.38 cm³로 줄였으며, GrabNet(2.65 cm³) 및 ManipNet(2.68 cm³)보다 뛰어난 정확도를 보이며 손-물체 교차를 효과적으로 방지한다.
- 모든 테스트 시퀀스에서 접촉 비율이 1.00으로 유지되어 GRIP이 손과 물체 간 일관되고 타당한 접촉을 유지함을 나타낸다.
- 왼손의 MPVPE(Mean Per-Vertex Position Error)는 6.17 mm, 오른손은 7.88 mm를 기록하여 GrabNet(8.18 mm) 및 ManipNet(7.78 mm)보다 우수한 성능을 보였다.
- RNet를 포함한 전체 GRIP 모델은 침투 비율에서 10% 향상되었으며, 최신 기술 대비 새로운 물체와 운동에 대한 일반화 능력도 뛰어나다.
- LTC와 보완을 통한 이중 단계 파이프라인은 움직임 품질을 크게 향상시켰으며, 추론 실험 결과 RNet가 GRIP에서 RNet를 제외한 경우 대비 침투를 25% 감소시킴을 입증했다.
- GRIP는 복잡한 이중손 잡기 및 섬세한 집기 동작을 포함한 다양한 물체 유형과 새로운 데이터셋(예: InterCap)에 효과적으로 일반화된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.