[논문 리뷰] GarmentNets: Category-Level Pose Estimation for Garments via Canonical Space Shape Completion
GarmentNets는 옷의 종류 수준에서 자세 추정을 위해 캐논리컬 공간에서 3D 형상 보완을 공유하는 방식으로, 얇고 비수밀러블러블 구조를 다룰 수 있도록 새로운 유풍수 필드 표현을 도입한다. 이는 형상 보완에서 기존의 점유 그리드 대비 최대 32.2% 향상된 성능을 달성하며, 실제 세계 및 시뮬레이션된 옷에 대해 효과적으로 일반화된다.
This paper tackles the task of category-level pose estimation for garments. With a near infinite degree of freedom, a garment's full configuration (i.e., poses) is often described by the per-vertex 3D locations of its entire 3D surface. However, garments are also commonly subject to extreme cases of self-occlusion, especially when folded or crumpled, making it challenging to perceive their full 3D surface. To address these challenges, we propose GarmentNets, where the key idea is to formulate the deformable object pose estimation problem as a shape completion task in the canonical space. This canonical space is defined across garments instances within a category, therefore, specifies the shared category-level pose. By mapping the observed partial surface to the canonical space and completing it in this space, the output representation describes the garment's full configuration using a complete 3D mesh with the per-vertex canonical coordinate label. To properly handle the thin 3D structure presented on garments, we proposed a novel 3D shape representation using the generalized winding number field. Experiments demonstrate that GarmentNets is able to generalize to unseen garment instances and achieve significantly better performance compared to alternative approaches.
연구 동기 및 목표
- 옷은 근본적으로 무한한 자유도를 가지며 심한 자기 음영을 겪기 때문에 종류 수준의 자세 추정 문제를 해결한다.
- 기존 방법이 완전한 가시성, 알려진 인스턴스 메쉬, 물리적 사전 지식에 의존하는 데서 비롯되는 제한을 극복하여, 새로운 옷에 대한 일반화 능력을 향상시킨다.
- 기존의 점유 그리드나 서피스 거리 함수와 같은 전통적 표현 방식이 부적합한 얇고 비수밀러블러블 천의 형상 표현에 적합한 강력한 3D 형상 표현을 개발한다.
- 한 종류의 옷에 대해 공통된 캐논리컬 공간을 사용하여, 훈련 중에 볼 수 없었던 새로운 옷 인스턴스에 대한 일반화를 가능하게 한다.
- 부분적인 RGB-D 관측치와 학습된 형상 보완, 암시적 워프 필드를 조합하여 작업 공간에서 정확한 자세 예측을 가능하게 하여 실질적인 로봇 조작을 지원한다.
제안 방법
- 표준화된 인간 자세를 사용해 각 옷 종류에 대해 캐논리컬 공간을 정의함으로써, 다양한 옷 인스턴스 간 종류 수준의 대응 학습을 가능하게 한다.
- 부분적인 3D 관측치(예: RGB-D 포인트 클라우드)를 캐논리컬 공간으로 매핑하고, 학습된 신경망을 사용해 완전하고 조밀한 3D 메쉬를 예측함으로써 3D 형상 보완을 수행한다.
- 얇고 연속적인 천의 기하학적 특성을 강력한 표면 기울기와 매끄러운 내부를 갖는 새로운 3D 형상 표현으로 일반화된 유풍수 필드(WNF)를 도입한다.
- 학습된 암시적 워프 필드 네트워크를 사용해 보완된 캐논리컬 메쉬를 실제 작업 공간으로 다시 매핑함으로써 이전 단계의 오차를 보정하고 자세 정확도를 향상시킨다.
- 예측된 메쉬의 정확도를 높이기 위해 사전에 정렬된 3D 메쉬와 조밀한 대응 레이블이 포함된 시뮬레이션 데이터를 사용해 엔드 투 엔드로 훈련함으로써 실제 세계의 볼 수 없는 옷에 대한 일반화를 가능하게 한다.
- 완성된 캐논리컬 메쉬를 실제 작업 공간으로 되돌리는 데에 학습된 워프 필드와 물리 시뮬레이션을 비교함. 학습된 필드는 NOCS 예측 오차를 자가 보정함으로써 물리 기반 방법을 능가한다.
실험 결과
연구 질문
- RQ1캐논리컬 공간 표현은 다양한 볼 수 없는 옷 인스턴스에 대해 종류 수준의 일반화를 가능하게 할 수 있는가?
- RQ2얇고 비수밀러블러블한 3D 천의 형상은 어떻게 효과적으로 표현할 수 있는가? 이는 정확한 형상 보완과 자세 추정을 지원해야 한다.
- RQ3작업 공간에서 직접 예측하거나 물리 기반 시뮬레이션을 사용하는 것과 비교해 캐논리컬 공간에서의 형상 보완이 더 나은 일반화와 성능을 보일 수 있는가?
- RQ4완성된 캐논리컬 메쉬를 실제 작업 공간으로 되돌리는 데에 학습된 암시적 워프 필드가 물리 시뮬레이션을 능가할 수 있는가?
- RQ5시뮬레이션된 데이터로 훈련된 모델이 주름지고 부분적으로 가시성이 낮은 실제 RGB-D 관측치에 대해 얼마나 잘 일반화되는가?
주요 결과
- 캐논리컬 메쉬에서 캐멀러 거리 기준으로 점유 그리드 대비 32.2% 향상된 형상 보완 오차, TDF 대비 18.7%, TSDF 대비 26.7% 향상된 성능을 기록했다.
- 모델은 실제로 볼 수 없는 실제 세계의 옷에 대해 효과적으로 일반화되며, 아이폰 12 프로 맥스로 촬영한 RGB-D 데이터로부터도 3D 기하 구조를 보완하고 자세를 추정하는 데 성공했다.
- 학습된 암시적 워프 필드는 물리 시뮬레이션 대비 평균 자세 오차를 68.5% 감소시켰으며, 바지의 경우 평균 오차는 1.41 cm로 물리 시뮬레이션의 1.64 cm보다 우수했다.
- 유풍수 필드 표현은 얇은 천의 형상을 정확하게 모델링할 수 있었으며, TDF의 과도한 부드러움과 점유 그리드의 볼륨 크기 제약을 피할 수 있었다.
- 볼 수 없는 옷 인스턴스에 대해, 셔츠의 경우 평균 캐멀러 거리 1.70 cm, 바지의 경우 1.41 cm를 기록하여 강력한 제로샷 일반화 능력을 입증했다.
- 부분 관측치나 극심한 자기 음영 상황에서도 캐논리컬 공간에서 전체 3D 메쉬를 보완함으로써, 표면의 30~40%만 가시할 경우에도 효과적으로 대응할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.