Skip to main content
QUICK REVIEW

[논문 리뷰] NeuralAnnot: Neural Annotator for in-the-wild Expressive 3D Human Pose and Mesh Training Sets.

Gyeongsik Moon, Kyoung Mu Lee|arXiv (Cornell University)|2020. 11. 23.
Human Pose and Action Recognition참고 문헌 40인용 수 9
한 줄 요약

NeuralAnnot는 다중 샘플 모델링과 보조 3D 지도를 활용하여 실외 이미지의 고품질 가짜 지상 진실(가짜-GT) 3D 인간 자세 및 메시 데이터를 효율적으로 생성하는 신경망 기반 애노테이터입니다. 기존의 개별 샘플 최적화 방법이 지닌 깊이 모호성과 장시간 최적화 문제를 해결하여 훈련 데이터 품질을 크게 향상시키고, 표현력 있는 3D 인간 자세 추정에서 최신 기술 수준의 성능을 달성합니다.

ABSTRACT

Recovering expressive 3D human pose and mesh from in-the-wild images is greatly challenging due to the absence of the training data. Several optimization-based methods have been used to obtain 3D human model fits from GT 2D poses, which serve as pseudo-groundtruth (GT) 3D poses and meshes. However, they often suffer from severe depth ambiguity while requiring long running time because of their per-sample optimization that only uses 2D supervisions and priors. The per-sample optimization optimizes a 3D human model on each sample independently; therefore, running it on a large number of samples consumes long running time. In addition, the absence of the 3D supervisions makes their framework suffer from depth ambiguity. To overcome the limitations, we present NeuralAnnot, a neural annotator that learns to construct in-the-wild expressive 3D human pose and mesh training sets. Our NeuralAnnot is trained on entire datasets by considering multiple samples together with additional 3D supervisions from auxiliary datasets; therefore, it produces far better 3D pseudo-GT fits much faster. We show that the newly obtained training set brings great performance gain, which will be publicly released with codes.

연구 동기 및 목표

  • 실외 이미지에 대한 표현력 있는 3D 인간 자세 및 메시 훈련 데이터의 부족을 해결한다.
  • 2D 지도만을 기반으로 하는 개별 샘플 최적화 방법에서 기인하는 깊이 모호성과 장시간 실행 문제를 극복한다.
  • 보조 3D 데이터셋과 다중 샘플의 동시 모델링을 활용하여 가짜-GT 3D 피팅 품질을 향상시킨다.
  • 표현력 있는 3D 인간 자세 및 메시 추정을 위한 대규모 훈련 세트를 생성하기 위한 확장 가능하고 빠르며 정확한 방법을 개발한다.
  • 우수한 공개된 훈련 데이터셋을 제공함으로써 후속 3D 인간 자세 추정 모델의 성능 향상을 가능하게 한다.

제안 방법

  • 다수의 실외 이미지에서 동시에 2D 키포인트 지도로부터 3D 인간 자세 및 메시를 예측하는 신경망인 NeuralAnnot을 훈련시킨다.
  • 외부 데이터셋에서 온 보조 3D 지도를 통합하여 네트워크가 정확한 깊이 및 형태 사전 지식을 학습하도록 유도한다.
  • 샘플 간 상호관계를 모델링하는 공동 최적화 프레임워크를 사용하여 깊이 일관성을 향상시키고 모호성을 감소시킨다.
  • 반복적인 개별 샘플 최적화를 단일 효율적인 신경 추론 프로세스로 대체하여 훈련 시간을 크게 단축시킨다.
  • 가능한 3D 인간 신체 모델을 미분 가능하게 활용하여 2D 지도에서부터 3D 피팅을 엔드 투 엔드로 학습할 수 있도록 한다.
  • 훈련 중 정규화 및 기하학적 사전 지식을 적용하여 현실적이며 일관된 3D 메시 및 자세 출력을 보장한다.

실험 결과

연구 질문

  • RQ1개별 샘플 최적화 없이 2D 지도로부터 신경망이 고품질의 3D 인간 자세 및 메시 애노테이션을 효과적으로 학습할 수 있는가?
  • RQ2보조 3D 데이터의 사용이 실외 환경에서의 가짜-GT 3D 피팅의 깊이 정확도와 현실성에 어느 정도 기여하는가?
  • RQ3다중 샘플의 동시 모델링이 독립적인 개별 샘플 최적화에 비해 깊이 모호성을 얼마나 줄이는가?
  • RQ4제안된 방법이 3D 피팅 품질을 유지하거나 향상시키면서도 추론 시간을 크게 단축시킬 수 있는가?
  • RQ5결과적으로 생성된 훈련 세트가 후속 3D 인간 자세 추정 모델의 성능 향상에 측정 가능한 기여를 하는가?

주요 결과

  • NeuralAnnot는 기존의 개별 샘플 최적화 방법보다 훨씬 더 정확한 3D 자세 및 메시 예측을 생성하여 공동 모델링을 통해 깊이 모호성을 줄였다.
  • 반복적인 개별 샘플 최적화를 단일 신경 추론 프로세스로 대체함으로써 상당한 속도 향상을 달성했다.
  • 보조 3D 데이터의 사용이 생성된 3D 가짜-GT 애노테이션의 현실성과 기하학적 일관성을 향상시켰다.
  • 결과적으로 생성된 훈련 세트가 후속 3D 인간 자세 추정 벤치마크에서 측정 가능한 성능 향상을 이끌어냈다.
  • 저자들은 생성된 훈련 데이터셋과 코드를 공개하여 광범위한 채택과 재현 가능성을 보장했다.
  • 신경 애노테이터는 다양한 실외 이미지 분포에 대해 잘 일반화되어 있으며, 가림과 복잡한 자세에 대한 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.