Skip to main content
QUICK REVIEW

[논문 리뷰] DensePose: Dense Human Pose Estimation In The Wild

Rıza Alp Güler, Natalia Neverova|arXiv (Cornell University)|2018. 02. 01.
Human Pose and Action Recognition인용 수 6
한 줄 요약

이 논문은 비구속적이고 실제 환경에서의 RGB 이미지와 파arametric human body 모델 간에 고밀도의 파트별 2D-3D 대응 관계를 설정하는 딥러닝 프레임워크인 DensePose-RCNN를 소개한다. 50,000장의 이미지로 구성된 DensePose-COCO 데이터셋을 생성하기 위해 새로운 애너테이션 파이프라인을 활용하고, 영역 기반 특징 학습, 부족한 지도 신호의 복원, 계층적 정밀 조정 기법을 적용함으로써, 최신 기술 수준의 정확도에 가까운 실시간 성능(20–26 FPS)을 달성한다. 이는 이상적인 평가 환경에서의 성능 상한선에 근접한다.

ABSTRACT

In this work, we establish dense correspondences between RGB image and a surface-based representation of the human body, a task we refer to as dense human pose estimation. We first gather dense correspondences for 50K persons appearing in the COCO dataset by introducing an efficient annotation pipeline. We then use our dataset to train CNN-based systems that deliver dense correspondence 'in the wild', namely in the presence of background, occlusions and scale variations. We improve our training set's effectiveness by training an 'inpainting' network that can fill in missing groundtruth values and report clear improvements with respect to the best results that would be achievable in the past. We experiment with fully-convolutional networks and region-based models and observe a superiority of the latter; we further improve accuracy through cascading, obtaining a system that delivers highly0accurate results in real time. Supplementary materials and videos are provided on the project page http://densepose.org

연구 동기 및 목표

  • 비구속적이고 실제 환경의 장면에서 2D RGB 이미지와 인간 신체의 3D 표면 표현 간에 고밀도의 파트별 대응 관계를 설정하기 위해.
  • 오염, 척도 변화, 배경 혼잡성 등의 과제를 해결하기 위해 밀도 높은 인간 자세 추정에 도전하기 위해.
  • 대규모의 이미지-표면 대응 관계 데이터셋을 생성하기 위한 확장 가능하고 효율적인 애너테이션 파이프라인을 개발하기 위해.
  • 복잡한 실제 환경 이미지에 대해 강건하게 일반화되면서도 높은 정확도와 실시간 추론 속도를 유지할 수 있도록 딥러닝 모델을 훈련하기 위해.

제안 방법

  • 애너테이터들이 인간 신체를 의미론적 파트로 분할하고, 렌더링된 파트 이미지를 사용해 샘플링된 3D 표면 점들을 해당 이미지 픽셀에 매핑함으로써 고밀도의 2D-3D 대응 관계 애너테이션을 가능하게 한다.
  • 완전 컨볼루션 네트워크 대신 영역 기반의 Faster R-CNN 스타일 백본(DensePose-RCNN)을 사용하여 척도 및 자세 변화에 대한 강건성을 향상시킨다.
  • 부족한 진정 지도 신호의 UV 좌표를 예측하기 위해 복원 네트워크를 훈련시어 지도 효과를 높이고 일반화 능력을 향상시킨다.
  • 이전 단계의 특징을 사용해 예측된 UV 좌표를 반복적으로 정밀 조정하는 계층적 정밀 조정 모듈을 도입하여 정확도를 크게 향상시킨다.
  • 인스턴스 세그멘테이션 및 키포인트 검출 헤드와 함께 다중 작업 학습을 수행하여 보조 지도 신호를 제공함으로써 고밀도 대응 관계 예측 성능을 향상시킨다.
  • 최종 모델은 DensePose-COCO 데이터셋에서 훈련되며 표준 GPU 하드웨어에서 실시간 추론 속도를 달성한다.

실험 결과

연구 질문

  • RQ1오염과 척도 변화가 존재하는 비구속적이고 실제 환경의 이미지에서 딥러닝 모델이 인간 신체에 대해 정확한 고밀도 2D-3D 대응 관계를 설정할 수 있는가?
  • RQ2밀도 높은 인간 자세 추정에 있어 완전 컨볼루션 네트워크 대비 영역 기반 특징 학습의 효과는 어떠한가?
  • RQ3부족한 지도 신호의 복원이 희소한 애너테이션 조건에서 모델의 일반화 능력과 성능 향상에 얼마나 기여하는가?
  • RQ4계층적 정밀 조정과 다중 작업 학습이 추론 속도를 희생시키지 않고 정확도를 크게 향상시킬 수 있는가?
  • RQ5완전히 지도된 엔드 투 엔드 딥러닝 시스템은 고밀도 인간 신체 대응 관계 추정에서 성능 상한선에 얼마나 가까이 다가설 수 있는가?

주요 결과

  • 다중 작업 학습과 계층적 정밀 조정을 적용한 DensePose-RCNN는 COCO minival 세트에서 55.8% AP를 달성하여 이전 방법들을 크게 능가한다.
  • 키포인트 지도 신호를 활용한 계층적 모델은 57.1% AP의 이상적 평가 조건에서 달성된 성능 상한선에 매우 가까운 성능을 보였다.
  • 영역 기반 처리(RCNN)는 척도 및 자세 변화 조건에서 완전 컨볼루션 네트워크보다 크게 승리하며 성능이 뛰어나다.
  • 지도 신호의 복원은 성능 향상에 상당한 기여를 하며, 자료가 부족한 환경에서 강화된 지도의 가치를 입증한다.
  • GTX 1080 GPU에서 240×320 이미지에 대해 20–26 FPS, 800×1100 이미지에 대해 4–5 FPS로 실행되어 실시간 추론이 가능하다.
  • 키포인트 및 마스크 헤드와 함께 다중 작업 학습을 수행하면 단일 작업 기반 베이스라인 대비 3.0% AP 향상으로 성능 향상이 뚜렷하게 나타났으며, 강력한 보조 지도의 효과를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.