Skip to main content
QUICK REVIEW

[논문 리뷰] CLIFF: Carrying Location Information in Full Frames into Human Pose and Shape Estimation

Zhihao Li, Jianzhuang Liu|arXiv (Cornell University)|2022. 08. 01.
Human Pose and Action Recognition인용 수 13
한 줄 요약

CLIFF는 상향식 방법에 전체 프레임의 글로벌 위치 정보를 통합하여 3D 인간 자세 및 형상 추정을 향상시키는 것을 제안한다. 바운딩 박스 특징과 전체 프레임 2D 재투영 손실을 사용하여 정확한 글로벌 회전 예측을 가능하게 한다. 이는 SOTA 성능을 달성하여 AGORA SMPL-Algorithms 트랙에서 1위를 차지했으며, 3DPW에서 54.8mm의 PA-MPJPE를 기록했다.

ABSTRACT

Top-down methods dominate the field of 3D human pose and shape estimation, because they are decoupled from human detection and allow researchers to focus on the core problem. However, cropping, their first step, discards the location information from the very beginning, which makes themselves unable to accurately predict the global rotation in the original camera coordinate system. To address this problem, we propose to Carry Location Information in Full Frames (CLIFF) into this task. Specifically, we feed more holistic features to CLIFF by concatenating the cropped-image feature with its bounding box information. We calculate the 2D reprojection loss with a broader view of the full frame, taking a projection process similar to that of the person projected in the image. Fed and supervised by global-location-aware information, CLIFF directly predicts the global rotation along with more accurate articulated poses. Besides, we propose a pseudo-ground-truth annotator based on CLIFF, which provides high-quality 3D annotations for in-the-wild 2D datasets and offers crucial full supervision for regression-based methods. Extensive experiments on popular benchmarks show that CLIFF outperforms prior arts by a significant margin, and reaches the first place on the AGORA leaderboard (the SMPL-Algorithms track). The code and data are available at https://github.com/huawei-noah/noah-research/tree/master/CLIFF.

연구 동기 및 목표

  • 자르기 과정에서 글로벌 위치 정보를 버리는 상향식 3D 인간 자세 추정 방법의 한계를 해결하여 글로벌 회전 예측의 정확도를 향상시키기 위해.
  • 특히 원본 카메라 좌표계에서의 글로벌 회전을 향상시키기 위해 전체 이미지의 통합적 맥락을 활용하여 관절이 있는 자세 추정의 정확도를 높이기 위해.
  • CLIFF의 글로벌 위치 인식 감독을 활용하여 실외 2D 데이터셋에 대해 고품질의 가짜 진짜 레이블(가짜 GT) 앤노테이터를 개발하여, 회귀 기반 모델에 대한 보다 나은 전반적 감독을 가능하게 하기 위해.
  • 자르기 이미지 감독이 유도하는 모호성을 줄이기 위해, 2D 재투영 손실이 왜곡되고 자세 보정이 잘못 이끄는 문제를 해결하기 위해.

제안 방법

  • CLIFF는 상향식 모델의 입력을 개선하기 위해 자른 이미지 특징과 바운딩 박스 좌표를 연결하여 원본 이미지 내의 공간적 위치와 스케일을 인코딩한다.
  • 예측된 3D 관절을 원본 이미지 평면에 투영하여 전체 이미지 공간에서 2D 재투영 손실을 계산한다. 이는 실제 투영 왜곡을 모방한다.
  • 표준 3D 관절 및 메ッシュ 손실에 더해 전체 프레임 2D 재투영 손실을 포함한 복합 손실로 모델을 훈련시켜 글로벌 회전을 감독한다.
  • CLIFF 아키텍처를 사용하여 고품질의 3D 앤노테이션을 2D 관절에서 생성하는 새로운 가짜 GT 앤노테이터를 훈련시킨다. 이는 전체 이미지 감독을 활용한다.
  • SMPL 모델의 강력한 암묵적 사전 지식을 유지하면서도 바운딩 박스 특징을 통해 위치를 명시적으로 인코딩함으로써 일반화 능력을 향상시킨다.
  • 기존의 상향식 모델(HMR 등)과 호환 가능하며, 글로벌 물체 회전을 포함한 다른 3D 추정 작업으로도 확장 가능하다.

실험 결과

연구 질문

  • RQ1전체 프레임에서 온 글로벌 위치 정보를 통합하면 3D 인간 자세 추정에서 글로벌 회전 추정의 정확도가 향상되는가?
  • RQ2자르기 영역이 아닌 전체 이미지 공간에서 2D 재투영 손실을 계산하면 관절이 있는 자세 예측 성능이 향상되는가?
  • RQ3CLIFF 기반의 가짜 GT 앤노테이터는 실외 2D 데이터셋에 대해 고품질의 3D 앤노테이션을 생성할 수 있는가? 이는 후속 회귀 성능 향상에 기여하는가?
  • RQ4기존 상향식 방법과 비교해 CLIFF는 표준 벤치마크에서 글로벌 회전 및 자세 정확도 측면에서 어떻게 성능을 내는가?

주요 결과

  • CLIFF는 3DPW 벤치마크에서 54.8mm의 PA-MPJPE를 기록하여 이전 방법들인 SPIN(66.9mm)과 EFT(60.7mm)를 모두 능가한다.
  • Human3.6M에서 CLIFF는 MPJPE를 85.4mm로 줄였고, PVE를 100.5mm로 줄여 기준 HMR 및 이전 SOTA 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 제거 실험에서 바운딩 박스 입력(CI)과 전체 프레임 재투영 손실(CS)이 모두 필수적임을 확인했으며, 둘 중 하나를 제거하면 MPJPE가 10mm 이상 증가했다.
  • CLIFF 기반의 가짜 GT 앤노테이터는 4장의 V100 GPU를 사용해 35,515장의 이미지에 대해 단 30분 만에 고품질의 3D 앤노테이션을 생성했으며, EFT와 같은 미세조정된 방법보다 빠르고 정확도가 높았다.
  • COCO에서 CLIFF가 생성한 가짜 GT로 훈련한 모델은 EFT 기반 감독 대비 3DPW에서 MPJPE가 13.2mm 향상되고 PVE가 20.5mm 향상되었다.
  • CLIFF는 AGORA 랭킹의 SMPL-Algorithms 트랙에서 1위를 기록하여 실제 실외 환경에서의 제약 없는 설정에서도 SOTA 성능을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.