[논문 리뷰] HMOR: Hierarchical Multi-Person Ordinal Relations for Monocular Multi-Person 3D Pose Estimation
이 논문은 단일 뷰 다인원 3D 자세 추정에서 전역 일관성을 향상시키기 위해 깊이 및 각도 관계를 계층적으로 인코딩하는 새로운 지도 학습 방법인 HMOR(Hierarchical Multi-Person Ordinal Relations)을 제안한다. 통합형 엔드 투 엔드 상향식 모델은 굵기에서 세밀한 깊이 보정 전략을 사용하여 인간 검출, 깊이, 3D 자세를 동시에 추정하며, MuPoTS-3D 및 CMU Panoptic 데이터셋에서 기존 최고 성능를 달성하면서도 계산 및 파라미터 비용을 낮춘다.
Remarkable progress has been made in 3D human pose estimation from a monocular RGB camera. However, only a few studies explored 3D multi-person cases. In this paper, we attempt to address the lack of a global perspective of the top-down approaches by introducing a novel form of supervision - Hierarchical Multi-person Ordinal Relations (HMOR). The HMOR encodes interaction information as the ordinal relations of depths and angles hierarchically, which captures the body-part and joint level semantic and maintains global consistency at the same time. In our approach, an integrated top-down model is designed to leverage these ordinal relations in the learning process. The integrated model estimates human bounding boxes, human depths, and root-relative 3D poses simultaneously, with a coarse-to-fine architecture to improve the accuracy of depth estimation. The proposed method significantly outperforms state-of-the-art methods on publicly available multi-person 3D pose datasets. In addition to superior performance, our method costs lower computation complexity and fewer model parameters.
연구 동기 및 목표
- 상향식 단일 뷰 다인원 3D 자세 추정 방법에서 전역 시나리오 이해의 부족을 해결하기 위해.
- 다양한 상호작용을 하는 인물이 있는 복잡하고 혼잡한 환경에서 깊이 모호성과 가림 현상을 줄이기 위해.
- 인간, 신체 부위, 관절 간의 계층적 순서 관계를 통합함으로써 절대 3D 자세 추정의 정확도를 향상시키기 위해.
- 인간 검출, 깊이 추정, 3D 자세 회귀를 동시에 수행할 수 있는 엔드 투 엔드 학습 가능한 통합 모델을 개발하기 위해.
- 기존 방법들과 비교해 모델 복잡성과 계산 비용을 줄이며 뛰어난 성능을 달성하기 위해.
제안 방법
- 세 수준(인간 인스턴스, 신체 부위, 관절)에서 깊이 및 각도 관계를 모델링하는 계층적 다인원 순서 관계(HMOR)를 도입한다.
- 계층적 수준 간의 상대적 깊이 및 각도 제약 조건으로 순서 지도 학습을 인코딩하여 예측된 3D 자세의 전역 일관성을 강제한다.
- 인간 검출, 3D 자세 추정, 인간 깊이 추정을 동시에 수행하는 통합 상향식 모델을 제안하며, 엔드 투 엔드 방식으로 작동한다.
- 거시적에서 미세한 깊이 추정 아키텍처를 활용: 먼저 전역 깊이 맵을 생성한 후 잔차 보정을 통해 개별 인간의 깊이를 보정한다.
- 2D 자세 애너테이션과 호환 가능한 2D-3D 혼합 학습 전략을 활용하여 효율적이고 효과적인 사전 학습을 가능하게 한다.
- HMOR 지도 학습과 표준 3D 자세 및 깊이 회귀 손실을 결합한 새로운 손실 함수를 제안하여 공동 최적화를 수행한다.
실험 결과
연구 질문
- RQ1인간, 신체 부위, 관절 간의 계층적 순서 관계가 단일 뷰 다인원 3D 자세 추정의 전역 일관성에 기여하는가?
- RQ2절대 3D 자세를 직접 회귀하는 것과 비교해 HMOR 지도 학습은 정확도와 강건성 측면에서 어떻게 성능을 내는가?
- RQ3거시적에서 미세한 깊이 추정 전략이 단일 RGB 이미지로부터 절대 3D 자세 추정 정확도를 얼마나 향상시키는가?
- RQ4통합형 엔드 투 엔드 모델이 검출, 깊이, 3D 자세 추정을 동시에 최적화하면서도 계산 비용을 줄일 수 있는가?
- RQ5혼합 2D 및 3D 애너테이션으로 훈련했을 때 제안된 방법의 효과는 어떠하며, 실외 환경에 대한 일반화 능력은 어떠한가?
주요 결과
- MuPoTS-3D 데이터셋에서 제안된 방법은 기존 최고 성능 방법 대비 12.3 PCK abs 향상률을 기록했다.
- CMU Panoptic 데이터셋에서 기존 연구 대비 MPJPE가 20.5 mm 향상되어 절대 자세 추정 정확도가 뛰어나다는 것을 입증했다.
- Moon 등 [39]의 유일한 오픈소스 기준 대비 모델 파라미터를 73% 감소시키고 GFLOPs를 41% 감소시켰다.
- HMOR 지도 학습은 절대 3D 자세 회귀에 비해 MPJPE를 7.4 mm 향상시켰으며, 인스턴스 수준의 관계가 절대 자세 정확도 향상에 가장 기여했다.
- 거시적에서 미세한 깊이 보정 전략은 직접 깊이 출력 대비 MPJPE를 15.1 mm 감소시켜 정확한 깊이 추정을 위한 필수성임을 입증했다.
- 훈련 중 추가적인 시야 방향을 샘플링하면 MPJPE가 0.6 mm 향상되어 복잡한 환경에 대한 일반화 능력 향상이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.