Skip to main content
QUICK REVIEW

[논문 리뷰] VoxelTrack: Multi-Person 3D Human Pose Estimation and Tracking in the Wild

Yifu Zhang, Chunyu Wang|arXiv (Cornell University)|2021. 08. 05.
Video Surveillance and Tracking Methods인용 수 5
한 줄 요약

VoxelTrack는 다중 시야 영상에서 3D 볼록체 기반 표현을 사용하여 3D 다인실체 자세 추정 및 추적 프레임워크를 엔드 투 엔드로 제안한다. 이는 2D 자세 추정 및 연관 과정에서 발생하는 노이즈를 피하기 위해 볼륨 공간에서 직접 3D 자세와 Re-ID 특징을 회귀함으로써, Shelf, Campus 및 CMU Panoptic 데이터셋에서 최신 기술 수준의 성능을 달성한다. 특히, 차폐 인식 Re-ID 특징 융합을 통해 98.67 IDF1과 0개의 ID 스위치를 기록한다.

ABSTRACT

We present VoxelTrack for multi-person 3D pose estimation and tracking from a few cameras which are separated by wide baselines. It employs a multi-branch network to jointly estimate 3D poses and re-identification (Re-ID) features for all people in the environment. In contrast to previous efforts which require to establish cross-view correspondence based on noisy 2D pose estimates, it directly estimates and tracks 3D poses from a 3D voxel-based representation constructed from multi-view images. We first discretize the 3D space by regular voxels and compute a feature vector for each voxel by averaging the body joint heatmaps that are inversely projected from all views. We estimate 3D poses from the voxel representation by predicting whether each voxel contains a particular body joint. Similarly, a Re-ID feature is computed for each voxel which is used to track the estimated 3D poses over time. The main advantage of the approach is that it avoids making any hard decisions based on individual images. The approach can robustly estimate and track 3D poses even when people are severely occluded in some cameras. It outperforms the state-of-the-art methods by a large margin on three public datasets including Shelf, Campus and CMU Panoptic.

연구 동기 및 목표

  • 노이즈가 있는 2D 검출로 인해 오류가 누적되는 계단식 2D 자세 추정 및 3D 복원 파ipeline의 한계를 해결한다.
  • 심한 차폐 및 외관 변화 상황에서의 다중 시야 2D 자세 연관 및 3D 자세 추적 과제를 극복한다.
  • 개별 시야의 품질에 의존도를 최소화하기 위해 다중 시야 정보를 공유된 3D 볼록체 공간에서 융합함으로써 강력한 3D 자세 추정 및 추적을 가능하게 한다.
  • 외관 특징이 손상된 경우에도 추적의 강성을 향상시키기 위해 차폐 인식 Re-ID 특징 융합 전략을 도입한다.
  • 실세계 배포에 적합한 실시간 성능(5대 카메라 기준 15 FPS)을 갖춘 경량 엔드 투 엔드 시스템을 설계한다.

제안 방법

  • 3D 공간을 이산화하고, 모든 카메라 시야에서의 신체 관절 히트맵을 역투영을 통해 볼록체 격자에 집계하여 3D 볼록체 격자를 구성한다.
  • 3D 희소 컨볼루션 네트워크를 사용하여 각 볼록체가 특정 신체 관절을 포함하는지 예측함으로써, 볼록체 표현에서 직접 3D 자세 추정을 수행한다.
  • 각 볼록체에 대해 Re-ID 특징을 동시에 예측하고, 차폐 마스크를 사용하여 과도하게 차폐된 시야에서의 신뢰도가 낮은 특징을 억제함으로써 다중 시야에서 특징을 융합한다.
  • 깊이 정보를 활용하여 차폐된 시야의 특징을 식별하고 제거하는 다중 시야 Re-ID 특징 융합 전략을 적용한다.
  • 3D 관절 유사도와 차폐 인식 Re-ID 특징을 조합하여 3D 자세 추적을 수행하며, 단순한 이분 매칭 추적기(트래커)를 사용한다.
  • 3D 자세 추정 헤드를 합성 데이터로 훈련시켜, 대규모 3D 실세계 애너테이션을 필요로 하지 않고도 실용적인 배포가 가능하도록 한다.

실험 결과

연구 질문

  • RQ1중간 단계로 2D 자세 추정 및 연관을 생략함으로써 3D 다인실체 자세 추정 및 추적 성능을 크게 향상시킬 수 있는가?
  • RQ2다중 시야 정보를 융합하는 데 있어 3D 볼록체 기반 표현이 차폐 상황에서도 강성 향상에 얼마나 효과적인가?
  • RQ3차폐 인식 Re-ID 특징 융합 전략이 도전적인 실세계 상황에서 추적 정확도 향상에 어느 정도 기여하는가?
  • RQ4합성 데이터에서 효과적으로 사전 훈련된 3D 자세 추정 네트워크를 실세계 데이터로 미세조정하여 실용적 배포가 가능한가?
  • RQ5엔드 투 엔드 3D 볼록체 기반 추적 시스템의 계산 효율성은 어떻게 되며, 실시간 추론 능력을 갖추고 있는가?

주요 결과

  • VoxelTrack는 CMU Panoptic 데이터셋에서 98.67 IDF1 점수와 0개의 ID 스위치를 기록하여 이전 방법들을 크게 능가한다.
  • 절단 실험 결과, 차폐 인식 Re-ID 특징 융합 전략이 필수적임을 확인하였으며, 원시 Re-ID 특징을 사용할 경우 ID 스위치가 90개에서 0개로 감소함을 입증하였다.
  • 3D 자세 거리만을 사용할 경우 IDF1는 93.82, ID 스위치는 90개로 나타나, 차폐 상황에서 자세 중심 추적의 한계를 드러낸다.
  • MobileNet-V2와 희소 3D 컨볼루션을 사용하여 5대 카메라 입력 기준 15 FPS로 시스템이 실행되며, 실시간 적용 가능성에 뛰어남을 보여준다.
  • 3D 자세 추정 헤드는 합성 데이터에서 훈련이 가능하며, 실세계 벤치마크로 일반화가 잘 되어 있어 애너테이션 의존도를 감소시킨다.
  • 추적 모듈은 추가로 약 2ms의 지연만을 유발하므로, 전체 시스템이 효율적이고 실시간 응용에 적합함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.