Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Pose Detection in Videos: Focusing on Occlusion

Justin Wang, Edward Xu|arXiv (Cornell University)|2020. 06. 24.
Human Pose and Action Recognition참고 문헌 8인용 수 4
한 줄 요약

이 논문은 두 단계로 구성된 3D 인간 자세 추정 프레임워크를 제안하며, 스택드 아워글라스 네트워크에서 유도한 2D 자세 예측과 오염 인식 시간 컨volution 네트워크(TCN)를 통합하여 영상에서 가림된 관절의 정확도를 향상시킨다. 정교화된 실린더 맨 모델을 사용해 오염 레이블을 생성하고, 수정된 손실 함수를 통해 TCN에 오염된 관절을 명시적으로 인식하도록 훈련시킴으로써, 선형 기준 모델 대비 5 mm 낮은 평균 관절 위치 오차(MPJPE)와 TCN 전용 기준 모델 대비 0.1 mm 낮은 MPJPE를 달성하면서도 계산 비용을 절감한다.

ABSTRACT

In this work, we build upon existing methods for occlusion-aware 3D pose detection in videos. We implement a two stage architecture that consists of the stacked hourglass network to produce 2D pose predictions, which are then inputted into a temporal convolutional network to produce 3D pose predictions. To facilitate prediction on poses with occluded joints, we introduce an intuitive generalization of the cylinder man model used to generate occlusion labels. We find that the occlusion-aware network is able to achieve a mean-per-joint-position error 5 mm less than our linear baseline model on the Human3.6M dataset. Compared to our temporal convolutional network baseline, we achieve a comparable mean-per-joint-position error of 0.1 mm less at reduced computational cost.

연구 동기 및 목표

  • 자기 오염 또는 물체에 의한 차폐로 인해 감지하기 어려운 관절에 대해 영상 내 3D 인간 자세 추정 정확도를 향상시키는 것.
  • 기존 3D 자세 추정 모델이 오염 조건에서 일반화 능력이 떨어지는 한계를 극복하기 위해 시간적 맥락과 명시적 오염 신호를 통합하는 것.
  • 3D 참조 관절 키포ints에서 오염 레이블을 생성하기 위해 실린더 맨 모델 히우리스틱을 정교화하여 더 견고하고 효율적인 오염 모델링 전략을 개발하는 것.
  • 2D 자세 예측과 오염 상태를 모두 활용해 정확한 3D 자세 추정을 수행하는 시간 컨volution 네트워크(TCN)를 훈련시켜 선형 및 표준 TCN 기준 모델을 초월하는 것.

제안 방법

  • 메인 3D 자세 추정 파이프라인의 입력으로 영상 프레임에서 2D 관절 키포인트 예측을 생성하기 위해 스택드 아워글라스 네트워크를 사용한다.
  • 3D 참조 관절 키포인트를 2D 투영으로 매핑하고 카메라 시야에서의 가시성에 따라 관절이 오염되었는지 여부를 결정하는 수정된 실린더 맨 모델 히우리스틱을 사용해 오염 레이블을 생성한다.
  • 핵심 모델은 2D 관절 좌표와 오염 벡터를 입력으로 받아 일련의 프레임에 걸쳐 3D 관절 위치를 예측하는 시간 컨볼루션 네트워크(TCN)이다.
  • 모델이 오염된 관절을 더 효과적으로 추론할 수 있도록, 참조 오염 레이블을 명시적으로 포함하는 수정된 손실 함수를 사용해 TCN를 훈련시킨다.
  • 프레임워크는 Human3.6M 및 HumanEva-I 데이터셋에서 평가되었으며, 다양한 오염 모델링 전략과 네트워크 변종을 비교하기 위한 분석 연구가 수행되었다.
  • 기본 가우시안 모델 대비 대체로 간단한 군집 오염 히우리스틱이 도입되어 일반화 능력을 향상시키고 특정 오염 패턴에 대한 과적합을 줄였다.

실험 결과

연구 질문

  • RQ1명시적 오염 신호를 사용해 훈련된 시간 컨volution 네트워크(TCN)가 표준 기준 모델 대비 영상 시퀀스에서 오염된 관절의 3D 자세 추정 정확도를 향상시킬 수 있는가?
  • RQ2제안된 오염 인식 TCN의 성능은 평균 관절 위치 오차(MPJPE) 측면에서 선형 회귀 기준 모델과 표준 TCN 기준 모델과 비교해 어떻게 되는가?
  • RQ3오염 레이블 생성을 위한 실린더 맨 모델 히우리스틱을 정교화함으로써, 관절이 오염된 경우 3D 자세 예측 능력이 얼마나 향상되는가?
  • RQ4손실 함수에 참조 오염 레이블을 포함해 훈련함으로써, 오염된 관절의 오차를 줄이고 일반화 능력을 향상시킬 수 있는가?
  • RQ5예를 들어 군집 오염 모델과 같은 단순화된 오염 히우리스틱이 더 복잡한 히우리스틱과 비교해 유사하거나 더 높은 성능을 내며 계산 오버헤드를 줄일 수 있는가?

주요 결과

  • 오염 인식 TCN는 Human3.6M 데이터셋에서 평균 관절 위치 오차(MPJPE) 23.01 mm를 기록했으며, 이는 선형 기준 모델 대비 5 mm 낮은 수치였다.
  • 표준 TCN 기준 모델과 비교해 제안된 방법은 MPJPE가 0.1 mm 낮았고, 계산 비용은 감소한 상태였다.
  • 정교화된 실린더 맨 모델을 사용한 오염 레이블 생성은 'SittingDown' 동작처럼 관절 오염이 빈번한 경우에 모델 성능 향상에 크게 기여했다.
  • 더 유연하게 관절을 오염으로 간주하는 군집 오염 히우리스틱은 기본 가우시안 오염 모델을 능가했으며, 다양한 오염 패턴에 걸쳐 일반화 능력을 향상시켜 모델의 강건성을 높였다.
  • 허벅지 관절이 무릎에 의해 자주 오염되는 'SittingDown' 동작에서, 시간적 맥락과 오염 신호를 효과적으로 활용함으로써 뛰어난 성능을 보였다.
  • 계산 자원 제약 상황에서도 오염 벡터를 히트맵 대신 사용했을 때 Human3.6M에서 테스트 오차 50.36 mm를 기록해, 제한된 자원 조건에서도 접근 방식의 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.