Skip to main content
QUICK REVIEW

[논문 리뷰] Monocular, One-stage, Regression of Multiple 3D People

Yu Sun, Qian Bao|arXiv (Cornell University)|2020. 08. 27.
Human Pose and Action Recognition참고 문헌 44인용 수 8
한 줄 요약

ROMP는 단일 RGB 이미지에서 다중 3D 인간 신체 메ッシュ를 엔드 투 엔드로 회귀하는 최초의 일단계, 단안 방법을 제안한다. 픽셀 수준의 표현 방식으로 신체 중심 히트맵과 메시 파라미터 맵을 사용하며, 겹치는 사람들을 해결하기 위해 충돌 인식형 반발력 장을 도입하여 최신 기술 수준의 성능과 30+ FPS의 실시간 추론(3DPW 및 CMU Panoptic과 같은 벤치마크에서)을 달성한다.

ABSTRACT

This paper focuses on the regression of multiple 3D people from a single RGB image. Existing approaches predominantly follow a multi-stage pipeline that first detects people in bounding boxes and then independently regresses their 3D body meshes. In contrast, we propose to Regress all meshes in a One-stage fashion for Multiple 3D People (termed ROMP). The approach is conceptually simple, bounding box-free, and able to learn a per-pixel representation in an end-to-end manner. Our method simultaneously predicts a Body Center heatmap and a Mesh Parameter map, which can jointly describe the 3D body mesh on the pixel level. Through a body-center-guided sampling process, the body mesh parameters of all people in the image are easily extracted from the Mesh Parameter map. Equipped with such a fine-grained representation, our one-stage framework is free of the complex multi-stage process and more robust to occlusion. Compared with state-of-the-art methods, ROMP achieves superior performance on the challenging multi-person benchmarks, including 3DPW and CMU Panoptic. Experiments on crowded/occluded datasets demonstrate the robustness under various types of occlusion. The released code is the first real-time implementation of monocular multi-person 3D mesh regression.

연구 동기 및 목표

  • 다중 단계 파이프라인의 한계, 특히 겹침과 잘린 영역 상황에서의 성능을 개선하기 위해.
  • 바운딩 박스에 의존하지 않고, 3D 신체 메시의 엔드 투 엔드, 픽셀 단위 예측을 가능하게 하기 위해.
  • 전체적인 픽셀 수준의 표현 방식을 통해 인물-인물 및 환경적 겹침 상황에서의 강건성을 향상시키기 위해.
  • 어려운 벤치마크에서 높은 정확도를 유지하면서도 실시간 추론 속도를 달성하기 위해.

제안 방법

  • 모델은 두 가지 명시적이고 미분 가능한 특징 맵을 예측한다: 2D 신체 중심 위치를 나타내는 신체 중심 히트맵과 픽셀 단위로 SMPL 신체 형태 및 자세 파라미터를 인코딩하는 메시 파라미터 맵.
  • 신체 중심 가이드 샘플링 과정을 통해 히트맵에서 지정된 위치에서 메시 파라미터 맵에서 3D 메시 파라미터를 추출하여 직접적인 메시 재구성 가능.
  • 충돌 인식 표현(CAR)은 신체 중심 간에 반발력 장을 도입하여 너무 가까이 있는 경우 서로 밀어내도록 하여 겹치는 영역에서의 문제를 해결.
  • 반발력 장은 물리 기반 모델을 사용하며, 신체 중심은 양전하처럼 행동하여 겹침 상황에서 중심의 구분 가능성과 샘플링 정확도를 향상시킨다.
  • 전체 네트워크는 히트맵 및 메시 파라미터 회귀를 조합한 다중 작업 손실을 사용하여 엔드 투 엔드로 훈련되며, 지표 신체 중심에 의해 가이드되는 supervision을 받는다.
  • 이전 방법에서 사용하는 국소적, 바운딩 박스 수준의 특징보다 전체 이미지의 맥락을 활용한 특징 학습을 통해 모호성을 감소시킨다.

실험 결과

연구 질문

  • RQ1일단계, 엔드 투 엔드 프레임워크가 다중 단계 파이프라인을 능가할 수 있는가?
  • RQ2픽셀 수준의 표현 방식이 인물-인물 및 환경적 겹침에 대해 강건성을 향상시킬 수 있는가?
  • RQ3충돌 인식 표현이 붐비는 장면에서 중심이 겹칠 경우의 모호성을 효과적으로 해결할 수 있는가?
  • RQ4전체 이미지 맥락에서 학습하면 실제 세계의 겹침 상황에서 일반화 능력과 성능이 향상되는가?
  • RQ5일단계 방법이 정확도를 희생시키지 않고도 실시간 추론 속도를 달성할 수 있는가?

주요 결과

  • ROMP는 3DPW 및 CMU Panoptic 벤치마크에서 최신 기술 수준의 성능을 달성하여, 모든 활동에서 기존의 다중 단계 방법을 능가한다.
  • 3DPW-PC(사람이 겹친 경우) 및 Crowdpose 벤치마크에서, 이전 방법 대비 각각 PMPJPE를 4.8%와 10.3% 감소시켰다.
  • 충돌 인식 표현(CAR)은 붐비는 장면에서 성능 향상을 크게 이끌었으며, γ=0.2일 때 Crowdpose에서 10.3% 향상되었다.
  • ROMP는 1070Ti GPU에서 30 FPS 이상으로 실행되어 단안 다중 인물 3D 메시 회귀의 최초 실시간 구현이다.
  • 장면 내 사람 수에 관계없이 일정한 추론 시간을 유지하며, 다중 단계 방법과 달리 사람 수에 따라 확장되지 않는다.
  • 제거 분석 결과, 주요 성능 향상 요인이 겹침 및 잘린 경우의 불확실성 해소에 기인함을 확인하여 픽셀 수준의 통합 표현의 효과를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.