[논문 리뷰] LISA: Learning Implicit Shape and Appearance of Hands
LISA는 다중 시야 RGB 영상과 원시 3D 손 뼈대 정보를 기반으로 정확한 3D 손 자세, 외형, 외관을 동시에 학습하는 신경 은닉 모델이다. 각 뼈대 별로 서명된 거리 함수(SDF)와 색상 예측을 학습된 스킨닝 가중치를 통해 통합함으로써, LISA는 이미지와 점군에서 최고 수준의 재구성 품질을 달성하며, 자세, 외형, 색상 매개변수를 분리 제어할 수 있다.
This paper proposes a do-it-all neural model of human hands, named LISA. The model can capture accurate hand shape and appearance, generalize to arbitrary hand subjects, provide dense surface correspondences, be reconstructed from images in the wild and easily animated. We train LISA by minimizing the shape and appearance losses on a large set of multi-view RGB image sequences annotated with coarse 3D poses of the hand skeleton. For a 3D point in the hand local coordinate, our model predicts the color and the signed distance with respect to each hand bone independently, and then combines the per-bone predictions using predicted skinning weights. The shape, color and pose representations are disentangled by design, allowing to estimate or animate only selected parameters. We experimentally demonstrate that LISA can accurately reconstruct a dynamic hand from monocular or multi-view sequences, achieving a noticeably higher quality of reconstructed hand shapes compared to baseline approaches. Project page: https://www.iri.upc.edu/people/ecorona/lisa/.
연구 동기 및 목표
- 다양한 주체에 걸쳐 세밀한 손 외형과 외관을 포괄하는 신경 은닉 모델을 개발하는 것.
- 부분적인 가림이 있더라도 일상적인 환경의 단시야 또는 다중 시야 영상에서도 정확한 3D 손 재구성 기능을 제공하는 것.
- 개선된 애니메이션과 제어를 위해 명시적으로 예측된 스킨닝 가중치를 통해 표면의 밀도 높은 대응 관계를 제공하는 것.
- 자세, 외형, 색상 표현을 분리하여 세밀한 조작과 일반화 능력을 향상시키는 것.
- 합성 및 실제 세계 데이터에서 기존의 매개변수 기반 메esh 모델과 은닉 모델을 모두 초월하는 재구성 정확도를 확보하는 것.
제안 방법
- 엔드 투 엔드 학습을 위해 원시 3D 손 뼈대 애너테이션을 포함한 다중 시야 RGB 영상 데이터셋을 활용한다.
- 손을 강체 뼈대의 집합으로 표현하며, 각 뼈대가 국소 좌표계에서 SDF와 색상을 예측하는 독립적인 신경망을 갖춘다.
- 예측된 스킨닝 가중치를 사용해 각 뼈대의 SDF 및 색상 예측을 통합된 은닉 표현으로 조합한다.
- 기울기 전파 가능한 렌더링 파이프라인을 사용해 학습 중에 외형 및 외관 손실을 최적화한다.
- 두 단계 최적화를 적용: 먼저 3D 자세를 정밀하게 조정하고, 그 다음에 외형, 자세, 색상 매개변수를 함께 최적화한다.
- 시각화 및 렌더링를 위해 128³ 해상도의 고해상도 메쉬를 재구성한다.

실험 결과
연구 질문
- RQ1신경 은닉 표현은 복잡하고 관절이 있는 손 기하학적 형태와 외관을 분리 제어 가능한 방식으로 효과적으로 모델링할 수 있는가?
- RQ2이러한 모델은 제약 없는 영상에서 새로운 손 주체와 임의의 자세로 일반화할 수 있는가?
- RQ3MANO와 같은 매개변수 기반 메쉬 모델이나 NARF 또는 NASA와 같은 은닉 모델에 비해 뛰어난 재구성 품질을 달성할 수 있는가?
- RQ4학습된 스킨닝 가중치를 사용한 각 뼈대 별 예측이 표면 대응 관계와 재구성 정밀도를 향상시키는가?
- RQ5모델이 단일 영상 또는 가림이 있는 실제 환경에서 손을 얼마나 잘 재구성할 수 있는가?
주요 결과
- LISA는 점군에서 3D 손 재구성에서 최고 수준의 성능을 달성했으며, 기준 스캔에 대한 피팅 시 밀리미터 이내의 오차를 기록했다.
- DeepHandMesh 데이터셋에서 LISA-im은 모든 이미지 전용 기준 모델보다 외형 재구성에서 뛰어난 성능을 보였으며, 1개 시야일 때 PSNR 27.45, 2개 시야일 때 28.40, 4개 시야일 때 28.27를 기록했다.
- InterHand2.6M 영상에서의 색상 재구성에서 LISA-full은 PSNR 28.27, SSIM 0.96, LPIPS 0.05를 기록했으며, 인지적 품질에서 NASA 및 NARF를 모두 능가했다.
- LISA는 높은 정밀도의 실제 환경 재구성을 가능하게 하여 부분적인 가림과 복잡한 조명 조건을 효과적으로 처리했다.
- 단일 P100 GPU에서 1개 시야당 약 1분 내외로 고해상도 신규 시야 렌더링을 수행할 수 있었다.
- LISA의 분리된 표현 방식은 외형, 색상, 자세를 별도로 조작할 수 있게 하여 정밀한 제어와 애니메이션을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.