Skip to main content
QUICK REVIEW

[논문 리뷰] Dense Human Body Correspondences Using Convolutional Networks

Lingyu Wei, Qixing Huang|arXiv (Cornell University)|2015. 11. 18.
3D Shape Modeling and Analysis참고 문헌 46인용 수 13
한 줄 요약

이 논문은 깊이 맵이나 부분적인 표면에서 완전한 밀도 있는 기하학적 구조, 일관된 시점, 또는 전체 신체 스캔이 없이도 3D 인간 스캔 간에 고밀도 실시간 대응 관계를 계산하기 위해 수정된 컨volution 신경망을 사용하는 딥러닝 방법을 제안한다. 경계 근처에서 매끄러운 특징 임bedding을 갖는 신체 영역을 분류하도록 네트워크를 훈련시킴으로써, 복잡한 자세를 취한 옷을 입은 및 벗은 인간에 대해 최신 기술 수준의 정확도를 달성하며, 기존의 비지도 학습 및 비정적 정렬 방법을 능가한다.

ABSTRACT

We propose a deep learning approach for finding dense correspondences between 3D scans of people. Our method requires only partial geometric information in the form of two depth maps or partial reconstructed surfaces, works for humans in arbitrary poses and wearing any clothing, does not require the two people to be scanned from similar viewpoints, and runs in real time. We use a deep convolutional neural network to train a feature descriptor on depth map pixels, but crucially, rather than training the network to solve the shape correspondence problem directly, we train it to solve a body region classification problem, modified to increase the smoothness of the learned descriptors near region boundaries. This approach ensures that nearby points on the human body are nearby in feature space, and vice versa, rendering the feature descriptor suitable for computing dense correspondences between the scans. We validate our method on real and synthetic data for both clothed and unclothed humans, and show that our correspondences are more robust than is possible with state-of-the-art unsupervised methods, and more accurate than those found using methods that require full watertight 3D geometry.

연구 동기 및 목표

  • 어떤 자세와 옷차림이든 간에 3D 인간 신체 스캔 간에 고밀도 실시간 대응 관계 계산을 가능하게 하며, 깊이 맵과 같은 부분적 또는 불완전한 데이터로부터도 가능하게 한다.
  • 기존의 비지도 학습 방법이 옷으로 인한 큰 변형, 가림, 또는 위상적 변화에 실패하는 데 기인한 한계를 극복한다.
  • RGB-D 센서를 사용하는 실제 스캔 환경에서 자주 이용할 수 없는 완전한 밀도 있는 3D 기하학적 구조에 대한 의존도를 줄인다.
  • SCAPE에서의 표준 자세 데이터와 Yobi3D 및 MIT 데이터셋의 옷을 입은 주제를 결합한 통합 학습 프레임워크를 개발하여 강력한 일반화 능력을 확보한다.
  • 훈련 데이터 요구량을 최소화하면서도 신체 영역 경계 근처의 특징 기술자 매끄러움을 향상시켜 대응 매칭에서의 이방성 오류를 줄인다.

제안 방법

  • 경계 근처에서 특징의 매끄러움을 향상시키는 데 중점을 두고, 깊이 맵 픽셀에서 신체 영역 분류를 예측하도록 수정된 AlexNet 기반의 딥 컨volution 신경망을 훈련시킨다.
  • 3D 표면의 반복적인 지오데식 세분화를 생성하기 위해 다중 세분화 기법을 적용하여, 네트워크가 특징 공간에서 더 매끄러운 임베딩을 학습하도록 이끈다.
  • SCAPE 데이터베이스(노르멀 주제)의 3D 스캔과 Yobi3D 및 MIT 데이터셋(옷을 입은 주제)의 스캔을 결합한 데이터셋을 사용하여, 정점별 레이블을 기반으로 네트워크를 엔드 투 엔드로 훈련시킨다.
  • 다양한 시점에서 깊이 맵을 렌더링하고 훈련된 네트워크의 정점별 특징을 평균화하여 정점별 특징 기술자를 추출한다.
  • 학습된 특징 공간에서 최근접 이웃 검색을 통해 고밀도 대응 관계를 계산한 후, 표준 비정적 정렬 알고리즘을 사용하여 정밀도를 향상시킨다.
  • 완전한 3D 모델, 부분 스캔, 또는 단일 깊이 맵 모두에서 작동하도록 설계되어 실시간 성능과 다양한 입력 유형에 대한 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1딥러닝 모델은 큰 변형과 옷차림 변화에도 일관된 특징 기술자를 유지할 수 있는 매끄럽고 구분력 있는 3D 인간 신체 스캔 특징 기술자를 학습할 수 있는가?
  • RQ2신경망은 신체 영역 경계 근처에서도 표면 상의 국소 기하학적 근접성을 유지하는 특징 임베딩을 생성할 수 있는가?
  • RQ3통합 네트워크 아키텍처는 다양한 자세와 부분적 입력 데이터를 가진 노르멀 및 옷을 입은 인간 주제에 대해 얼마나 잘 일반화되는가?
  • RQ4완전한 밀도 있는 3D 기하학적 구조나 정렬된 초기 자세가 없이도 높은 정확도의 고밀도 대응 관계를 달성할 수 있는가?
  • RQ5훈련 중 반복적인 메쉬 세분화를 사용하면 훈련 샘플 수를 크게 줄일 수 있고, 대응 관계의 강건성은 향상되는가?

주요 결과

  • 제안된 방법은 FAUST 데이터셋에서 내부 주제 쌍에 대해 평균 오차 2.00 cm, 외부 주제 쌍에 대해 2.35 cm를 기록하며, 모든 이전의 비지도 학습 방법을 능가하고, Chen 등 [10]의 최신 비정적 정렬 방법과 동등한 성능을 달성한다.
  • 비정적 정밀도 후 (CNN-S), 내부 주제 쌍에 대해 10cm 재현율 0.975, 외부 주제 쌍에 대해 0.972를 기록하며, RF(0.658) 및 BIM(0.615)와 비교해 뚜렷이 뛰어난 성능을 보인다.
  • 이 방법은 스캔 쌍당 1초 이내에 고밀도 대응 관계를 계산하여 실시간 성능를 입증하였으며, 기존의 비정적 정렬 기법보다 훨씬 느린 편이다.
  • 다중 세분화 기반 훈련을 통해 신체 영역 경계 근처의 특징 공간 이방성 오류가 감소하여, 표준 분류 네트워크보다 강건성이 향상된다.
  • 부분-부분 및 부분-전체 형태의 형태 매칭에 잘 일반화되어, 한 입력만 완전한 모델이어도 정확한 대응 관계를 제공한다.
  • 반복적인 지오데식 세분화 기반의 매끄러움 유도 훈련 목표 덕분에 기존 방법보다 훈련 데이터 요구량을 줄일 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.