Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-person Articulated Tracking with Spatial and Temporal Embeddings

Sheng Jin, Wentao Liu|arXiv (Cornell University)|2019. 03. 21.
Human Pose and Action Recognition참고 문헌 33인용 수 7
한 줄 요약

이 논문은 공간 키포인트 그룹화를 위한 SpatialNet과 시간적 궤적 연동을 위한 TemporalNet을 사용하여 다중 인물의 관절 구조적 자세 추적을 위한 통합적이고 엔드 투 엔드로 학습 가능한 프레임워크를 제안한다. 키포인트 임베딩(KE), 공간 인스턴스 임베딩(SIE), 인간 임베딩(HE), 시간적 인스턴스 임베딩(TIE)을 도입하고, 미분 가능한 자세 유도 그룹화(PGG) 모듈을 함께 사용함으로써, PoseTrack에서 MOTA를 65.4%에서 71.8%로 향상시켜 최신 기술 수준을 달성한다.

ABSTRACT

We propose a unified framework for multi-person pose estimation and tracking. Our framework consists of two main components,~\ie~SpatialNet and TemporalNet. The SpatialNet accomplishes body part detection and part-level data association in a single frame, while the TemporalNet groups human instances in consecutive frames into trajectories. Specifically, besides body part detection heatmaps, SpatialNet also predicts the Keypoint Embedding (KE) and Spatial Instance Embedding (SIE) for body part association. We model the grouping procedure into a differentiable Pose-Guided Grouping (PGG) module to make the whole part detection and grouping pipeline fully end-to-end trainable. TemporalNet extends spatial grouping of keypoints to temporal grouping of human instances. Given human proposals from two consecutive frames, TemporalNet exploits both appearance features encoded in Human Embedding (HE) and temporally consistent geometric features embodied in Temporal Instance Embedding (TIE) for robust tracking. Extensive experiments demonstrate the effectiveness of our proposed model. Remarkably, we demonstrate substantial improvements over the state-of-the-art pose tracking method from 65.4\% to 71.8\% Multi-Object Tracking Accuracy (MOTA) on the ICCV'17 PoseTrack Dataset.

연구 동기 및 목표

  • 장애물, 움직임, 카메라 이동 등 복잡한 영상에서 다중 인물의 관절 구조적 추적 문제를 해결한다.
  • 기존 방법들이 OKS 및 IoU와 같은 작업 무관한 유사도 측정 기준이나 후처리에 의존하는 한계를 극복한다.
  • 그룹화를 학습 파이프라인에 통합함으로써 자세 추정과 추적의 엔드 투 엔드 학습을 가능하게 한다.
  • 시간에 걸쳐 외관(HE)과 기하학적(TIE) 특징을 조합함으로써 강건성을 향상시키고, 프레임 내에서 키포인트(KE)와 공간(SIE) 특징을 결합한다.
  • 백프로파게이션을 통해 추적 오차를 저수준 특징 학습 단계로 전파할 수 있도록, 미분 가능한 자세 유도 그룹화 모듈을 개발한다.

제안 방법

  • SpatialNet은 키포인트 임베딩(KE)과 공간 인스턴스 임베딩(SIE)를 사용하여 단일 프레임 내에서 신체 부위 검출 및 부위 수준의 그룹화를 수행하며, 더 나은 해석 가능성과 수렴성을 확보하기 위해 보조적인 순서 관계 예측을 수행한다.
  • 자세 유도 그룹화(PGG) 모듈은 전체 검출 및 그룹화 파이프라인을 미분 가능하게 하고 엔드 투 엔드로 학습 가능한 구조로 만든다. 이로써 추적 손실에서 특징 추출 단계까지 기울기 흐름이 가능해진다.
  • TemporalNet은 인간 임베딩(HE)을 통해 통합적인 외관 특징과 시간적 인스턴스 임베딩(TIE)을 통해 프레임 간 일관성을 확보함으로써 공간 그룹화를 시간적 추적으로 확장한다.
  • HE와 TIE는 함께 최적화되어, TIE가 자세 변화에 강건하고, HE가 카메라 이동에 강건하도록 균형을 이룹니다. 이는 도전적인 조건에서도 더 신뢰할 수 있는 추적을 가능하게 한다.
  • 공유 백본을 사용하여 효율적인 특징 학습을 위한 공간 및 시간 임베딩을 통합된 아키텍처에 통합한다.
  • 다중 작업 학습 전략은 키포인트 검출, 임베딩 예측, 순서 관계 감독을 결합하여 일반화 능력과 학습 안정성을 향상시킨다.

실험 결과

연구 질문

  • RQ1공간 및 시간 임베딩을 통합한 통합적이고 엔드 투 엔드로 학습 가능한 프레임워크가 다중 인물 자세 추적 성능을 향상시킬 수 있는가?
  • RQ2시간 영역에서 조합된 외관(HE) 및 기하학적(TIE) 특징은 단일 측정 기준과 비교해 자세 변화 및 카메라 이동에 대해 얼마나 더 강건한가?
  • RQ3미분 가능한 그룹화 모듈(PGG)을 도입함으로써, 비미분 가능한 후처리 기반 방법과 비교해 부위 수준 및 인스턴스 수준의 연동 정확도가 얼마나 향상되는가?
  • RQ4보조적인 순서 예측을 통해 기하학적 순서 제약 조건을 도입함으로써, 키포인트 임베딩(KE) 및 공간 인스턴스 임베딩(SIE)의 해석 가능성과 성능이 얼마나 향상되는가?
  • RQ5OKS 및 IoU와 같은 작업 무관한 측정 기준을 사용하는 최신 기술 수준의 추적 기반 모델과 비교해, 도전적인 영상 조건 하에서 MOTA 및 AP 측정 기준으로 제안된 방법의 성능은 어떠한가?

주요 결과

  • 제안된 방법은 ICCV’17 PoseTrack 데이터셋에서 기존 최신 기술 수준인 65.4%보다 높은 새로운 최신 기술 수준 MOTA 71.8%를 달성하였다.
  • MS-COCO 데이터셋에서는 모델 앙상블이나 보정 없이 단일 프레임 자세 추정에서 77.0 AP를 기록하였으며, 다중 스케일 추론 조건 하에서 이전 방법보다 3% AP 높은 성능을 보였다.
  • 제거 분석 결과, KE와 SIE에 보조적인 순서 예측 및 PGG를 결합한 조합이 최고의 성능을 보였으며, MS-COCO에서 77.0 AP, PoseTrack에서 71.8% MOTA를 기록하였다.
  • 자세 유도 그룹화(PGG) 모듈은 임베딩의 밀도와 정확도를 크게 향상시켰다. 그림 시각화 결과, 동일한 사람의 픽셀들이 PGG 이후 더 일관된 임베딩 값을 가지게 되었다.
  • HE와 TIE를 포함한 TemporalNet은 뛰어난 추적 강건성을 확보한다: HE는 카메라 줌 및 이동을 처리하고, TIE는 큰 자세 변화와 가림 상황에서도 일관성을 유지한다.
  • 실행 시간 분석 결과, 이 방법은 높은 효율성을 유지한다. SpatialNet은 정확도는 상위 탑다운 기반 모델을 능가하면서도 계산 비용은 낮게 유지하고, TemporalNet은 그래프 컷 기반 추적기보다 더 효율적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.