Skip to main content
QUICK REVIEW

[논문 리뷰] A Simple, Fast and Highly-Accurate Algorithm to Recover 3D Shape from 2D Landmarks on a Single Image

Ruiqi Zhao, Yan Wang|arXiv (Cornell University)|2016. 09. 28.
Face recognition and analysis참고 문헌 17인용 수 4
한 줄 요약

이 논문은 단일 이미지에서 2D 지점으로부터 3D 형상을 정확하게 복원하는 피드포워드 딥 네ural 네트워크를 제안한다. 얼굴의 경우 재구성 오차가 0.004 이하, 자동차의 경우 0.0022 이하, 신체의 경우 0.022 이하, 깃발의 경우 0.0004 이하에 머무르며, 최신 기술 대비 최대 두 배 이상의 성능 향상을 이룬다. 모델은 빠르게 학습되며, 1초당 1,000 프레임 이상의 속도로 실행되며, 혁신적인 데이터 증강 기법을 통해 노이즈와 누락 데이터에 강건하다.

ABSTRACT

Three-dimensional shape reconstruction of 2D landmark points on a single image is a hallmark of human vision, but is a task that has been proven difficult for computer vision algorithms. We define a feed-forward deep neural network algorithm that can reconstruct 3D shapes from 2D landmark points almost perfectly (i.e., with extremely small reconstruction errors), even when these 2D landmarks are from a single image. Our experimental results show an improvement of up to two-fold over state-of-the-art computer vision algorithms; 3D shape reconstruction of human faces is given at a reconstruction error < .004, cars at .0022, human bodies at .022, and highly-deformable flags at an error of .0004. Our algorithm was also a top performer at the 2016 3D Face Alignment in the Wild Challenge competition (done in conjunction with the European Conference on Computer Vision, ECCV) that required the reconstruction of 3D face shape from a single image. The derived algorithm can be trained in a couple hours and testing runs at more than 1, 000 frames/s on an i7 desktop. We also present an innovative data augmentation approach that allows us to train the system efficiently with small number of samples. And the system is robust to noise (e.g., imprecise landmark points) and missing data (e.g., occluded or undetected landmark points).

연구 동기 및 목표

  • 단일 이미지의 2D 지점만을 사용하여 강체, 관절 구조, 고도로 변형 가능한 물체에 적용 가능한 일반적인 알고리즘을 개발하는 것.
  • 비밀도 또는 희박한 2D 기준점과 비선형 변형을 다룰 때 기존 방법의 낮은 정확도 문제를 해결하는 것.
  • 고정밀도와 노이즈 및 누락 데이터에 대한 강건성을 유지하면서도 실시간 성능(1초당 1,000 프레임 이상)을 달성하는 것.
  • 다양한 카메라 모델 기반의 혁신적인 데이터 증강 전략을 통해 소규모 데이터셋에서도 효과적으로 학습할 수 있도록 하는 것.

제안 방법

  • 2D 지점 좌표에서 3D 형상으로의 매핑을 학습하기 위해 피드포워드 딥 네ural 네트워크를 사용하며, 깊이를 복원하기 위해 계층적인 비선형 변환을 적용한다.
  • 예측된 3D 좌표와 진짜 3D 좌표 간의 L2 거리 최소화를 목표로 하는 손실 함수를 사용하여 네트워크를 엔드 투 엔드로 학습시킨다.
  • 혁신적인 데이터 증강 기법을 통해 단일 3D 포인트 클라우드에서 여러 카메라 시점, 크기, 시점의 시뮬레이션을 통해 합성 2D 지점 좌표를 생성한다.
  • 대규모 데이터셋에는 미니배치 학습을 사용하고, 동일한 아키텍처는 증강된 데이터를 통해 소규모 데이터셋을 효율적으로 처리할 수 있다.
  • 모델은 전역 스케일에 대해 불변이며, 스케일 인자와 무관하게 3D 형상을 독립적으로 추정한다.
  • 손상되거나 불완전한 지점 집합을 사용하여 학습함으로써 노이즈 및 누락 데이터에 대한 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1단일 딥 네럴 네트워크가 강체, 관절 구조, 고도로 변형 가능한 형상 등 다양한 물체 유형을 2D 지점 좌표만으로 일반화하여 처리할 수 있는가?
  • RQ2최신 기술 대비 상당한 정확도 향상을 이룰 수 있을 뿐 아니라 실시간 추론 속도를 유지할 수 있는가?
  • RQ32D 지점 좌표가 노이즈가 있거나 일부가 누락된 경우에도 딥 러닝 모델이 얼마나 정확하고 강건하게 유지될 수 있는가?
  • RQ4실제 3D-2D 데이터 쌍이 제한적인 경우, 합성 데이터 증강을 통해 효과적인 학습을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 인간 얼굴에서 평균 3D 재구성 오차가 0.004로, 이전 최신 기술 대비 뚜렷한 성능 향상을 보였다.
  • 자동차의 경우 평균 재구성 오차가 0.0022로, 강체이자 세밀한 구조를 가진 물체에 대해 높은 정확도를 입증했다.
  • 신체의 경우 평균 오차가 0.022로, 관절이 있는 구조물에 대해 강력한 성능을 보였다.
  • 고도로 변형 가능한 깃발의 경우 평균 오차가 0.0004로 매우 낮아 비강체적이고 동적인 형상에 대해 뛰어난 성능을 보였다.
  • i7 데스크톱에서 1초당 1,000 프레임 이상의 속도로 실행되어 실시간 성능을 초과했다.
  • 지점 좌표에 최대 5%의 가우시안 노이즈가 존재하거나, 각 샘플당 최대 하나의 지점이 누락된 경우에도 낮은 오차를 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.