Skip to main content
QUICK REVIEW

[논문 리뷰] S$^2$Contact: Graph-based Network for 3D Hand-Object Contact Estimation with Semi-Supervised Learning

Tze Ho Elden Tse, Zhongqun Zhang|arXiv (Cornell University)|2022. 08. 01.
Hand Gesture Recognition Systems인용 수 5
한 줄 요약

이 논문은 단일 RGB 영상에서 3D 손-물체 접촉 추정을 위한 준지도 학습 기반의 그래프 기반 딥러닝 프레임워크인 S$^2$Contact를 제안한다. 비디오 프레임 간의 시각적 및 기하학적 일관성을 활용하여 고품질의 가짜 레이블을 생성하고, PointNet 기반 모델보다 50% 적은 파라미터와 낮은 메모리 비용을 가지는 효율적인 그래프 신경망을 사용함으로써, HO-3D, HP-3D 및 FreiHand에서 최신 기술 수준(SOTA) 성능을 달성한다. 실제 레이블이 제한된 조건에서도 접촉 커버리지와 자세 정확도를 크게 향상시킨다.

ABSTRACT

Despite the recent efforts in accurate 3D annotations in hand and object datasets, there still exist gaps in 3D hand and object reconstructions. Existing works leverage contact maps to refine inaccurate hand-object pose estimations and generate grasps given object models. However, they require explicit 3D supervision which is seldom available and therefore, are limited to constrained settings, e.g., where thermal cameras observe residual heat left on manipulated objects. In this paper, we propose a novel semi-supervised framework that allows us to learn contact from monocular images. Specifically, we leverage visual and geometric consistency constraints in large-scale datasets for generating pseudo-labels in semi-supervised learning and propose an efficient graph-based network to infer contact. Our semi-supervised learning framework achieves a favourable improvement over the existing supervised learning methods trained on data with `limited' annotations. Notably, our proposed model is able to achieve superior results with less than half the network parameters and memory access cost when compared with the commonly-used PointNet-based approach. We show benefits from using a contact map that rules hand-object interactions to produce more accurate reconstructions. We further demonstrate that training with pseudo-labels can extend contact map estimations to out-of-domain objects and generalise better across multiple datasets.

연구 동기 및 목표

  • 손-물체 접촉 추정을 위한 3D 레이블 데이터의 부족, 특히 제약 없는 실세계 환경에서의 문제를 해결하기 위해.
  • 접촉 맵을 통해 접촉 상호작용을 더 현실적으로 모델링하여 3D 손 및 물체 재구성 정확도를 향상시키기 위해.
  • 완전한 지도 학습 없이도 도메인 외 객체와 미리보지 않은 데이터셋으로의 일반화를 가능하게 하기 위해.
  • 일관성 제약 조건을 통해 생성된 가짜 레이블을 활용하여 고비용 3D 레이블링에 대한 의존도를 줄이기 위해.
  • 기존 PointNet 기반 아키텍처보다 더 효율적이고 정확한 접촉 추정 네트워크를 설계하기 위해.

제안 방법

  • 비디오 시퀀스 간의 시각적 및 기하학적 일관성을 활용하여 가짜 레이블을 생성하는 준지도 학습 프레임워크를 제안한다.
  • 이웃 프레임 간의 시각적 일관성을 SSIM 기반 손실을 통해 강제하여 외관 안정성을 확보한다.
  • 기하학적 일관성을 Chamfer 거리 및 SDF 기반 손실을 사용하여 3D 포인트 클라우드의 구조적 정밀도를 유지한다.
  • 예측된 접촉 맵의 시간적 안정성을 확보하기 위해 접촉 일관성 손실($\mathcal{L}_{cont}$)을 도입한다.
  • 손 및 물체의 포인트 클라우드를 처리하는 효율적인 그래프 기반 신경망을 사용하여 국소 기하 구조를 포착하면서도 순열 불변성을 유지한다.
  • 학습에 사용하기 전에 일관성 손실 기반 신뢰도 임계값을 활용해 가짜 레이블을 필터링한다.

실험 결과

연구 질문

  • RQ1시각적 및 기하학적 일관성 제약 조건을 갖춘 준지도 학습이 단일 영상에서 3D 손-물체 접촉 추정 성능을 향상시킬 수 있는가?
  • RQ2더 적은 파라미터와 낮은 메모리 사용량으로도 그래프 기반 네트워크가 PointNet 기반 모델보다 접촉 추정 성능에서 뛰어나게 할 수 있는가?
  • RQ3시각적 및 기하학적 일관성에 기반한 가짜 레이블 사용이 도메인 외 객체로의 일반화 성능 향상에 기여하는가?
  • RQ4다양한 일관성 제약 조건(시각적, 기하학적, 접촉)이 최종 성능에 각각 어떤 기여를 하는가?
  • RQ5작은 레이블이 부여된 데이터셋에서부터 레이블이 없는 다양한 데이터셋으로의 모델 전이가 효과적으로 이루어질 수 있는가?

주요 결과

  • S$^2$Contact는 HO-3D에서 손 관절 오차 8.74 mm를 기록하며, 준지도 학습을 적용하지 않은 기준 모델 대비 12% 상대적 향상률을 보였다.
  • 모델은 ADD-0.1D 기준 물체 메쉬 오차를 8.56% 감소시키고, 비준지도 학습 기반 기준 모델 대비 접촉 커버리지를 58% 향상시켰다.
  • 접촉 일관성 손실($\mathcal{L}_{cont}$)을 비활성화할 경우 물체 오차가 5.45% 증가하고 학습이 불안정해지는 현상이 발생했다.
  • 시각 일관성 손실($\mathcal{L}_{SSIM}$)이 가장 큰 영향을 미치며, 이 손실을 제거할 경우 물체 오차가 8.04% 증가했다.
  • 제안된 그래프 네트워크는 DGCNN 대비 2.4배 적은 파라미터와 2배 적은 GPU 메모리 사용량을 기록했으며, 더 뛰어난 성능을 달성했다.
  • 모델는 도메인 외 객체로의 일반화 성능이 뛰어나며, 다양한 데이터셋 간 강력한 제로샷 전이 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.