Skip to main content
QUICK REVIEW

[논문 리뷰] Single-Network Whole-Body Pose Estimation

Gines Hidalgo, Yaadhav Raaj|arXiv (Cornell University)|2019. 09. 30.
Human Pose and Action Recognition참고 문헌 72인용 수 13
한 줄 요약

이 논문은 2D 전체 신체 자세 추정을 위한 최초의 단일 네트워크, 단일 단계 접근법을 제안하며, 다중 작업 학습을 통해 신체, 얼굴, 손, 발 관절 키포인트를 동시에 검출한다. 특히 신체/발 관절 검출과 얼굴/손 관절 검출 간 척도 차이를 다루는 새로운 아키텍처를 사용한다. 실시간 추론이 사람 수에 관계없이 가능하며, OpenPose보다 속도(사람 수 n명일 때 최대 n배 빠름)와 정확도에서 뛰어나며, 특히 가림, 흐림, 저해상도인 얼굴과 손에 대해서도 우수한 성능을 보인다. 또한 단일 단계에서 훈련하여 시간을 단축시켰다.

ABSTRACT

We present the first single-network approach for 2D~whole-body pose estimation, which entails simultaneous localization of body, face, hands, and feet keypoints. Due to the bottom-up formulation, our method maintains constant real-time performance regardless of the number of people in the image. The network is trained in a single stage using multi-task learning, through an improved architecture which can handle scale differences between body/foot and face/hand keypoints. Our approach considerably improves upon OpenPose~\cite{cao2018openpose}, the only work so far capable of whole-body pose estimation, both in terms of speed and global accuracy. Unlike OpenPose, our method does not need to run an additional network for each hand and face candidate, making it substantially faster for multi-person scenarios. This work directly results in a reduction of computational complexity for applications that require 2D whole-body information (e.g., VR/AR, re-targeting). In addition, it yields higher accuracy, especially for occluded, blurry, and low resolution faces and hands. For code, trained models, and validation benchmarks, visit our project page: https://github.com/CMU-Perceptual-Computing-Lab/openpose_train.

연구 동기 및 목표

  • 다수의 사람으로 구성된 장면에서 신체, 얼굴, 손, 발의 2D 전체 신체 관절 키포인트 추정을 동시에 수행할 수 있는 통합된 실시간 방법이 부족한 문제를 해결한다.
  • 단일 모델 내에서 큰 수용장역할을 하는 신체/발 관절 검출과 고해상도의 얼굴/손 관절 검출 간 척도 격차를 해결한다.
  • OpenPose와 같은 다단계 접근법이 각 사람마다 별도의 네트워크를 실행하는 바람에 발생하는 계산 병목 현상을 제거한다.
  • 다양한 관절 유형 간 공유된 특징 학습을 통해, 가림, 흐림, 저해상도 등의 어려운 조건에서도 일반화 능력을 향상시킨다.
  • 각 작업을 별도로 훈련하는 대신 단일 단계에서 모든 관절 키포인트 작업을 동시에 훈련하여 훈련 시간과 복잡도를 감소시킨다.

제안 방법

  • 다중 작업 학습(MTL)을 통해 단일 네트워크 아키텍처를 제안하며, 신체, 얼굴, 손, 발 관절 키포인트의 히트맵을 동시에 회귀한다.
  • 신체/발 검출을 위한 큰 수용장역할과 얼굴/손 관절 정확한 위치 추정을 위한 고해상도 표현 간 균형을 이루기 위해 다중 척도 특징 융합 기반의 새로운 백본을 설계한다.
  • 모든 관절 키포인트 검출 헤드를 동시에 최적화하는 단일 단계 훈련 파이프라인을 적용하여, 다중 네트워크 접근법 대비 약 50% 감소한 훈련 시간을 확보한다.
  • 데이터 증강과 커리큘럼 학습을 적용하여, 특히 저해상도 및 가림된 얼굴과 손에 대한 일반화 능력을 향상시킨다.
  • 하나의 네트워크에서 신체 관절 키포인트를 먼저 검출하고, 이후 얼굴/손 헤드로 보완하는 바텀업 설정을 활용하여 사람 수에 관계없이 일정한 추론 시간을 유지한다.
  • 공유된 특징 추출기와 작업별 특화된 헤드를 사용하며, 각 헤드는 고유한 척도 및 공간 해상도 요구 조건에 최적화된다.

실험 결과

연구 질문

  • RQ1단일 딥 네트워크가 단일 순전파에서 효과적이고 효율적으로 2D 전체 신체 관절 구성(신체, 얼굴, 손, 발)을 추정할 수 있는가?
  • RQ2정확도나 속도를 희생시키지 않고도 통합 아키텍처 내에서 신체/발과 얼굴/손 관절 검출 간 척도 격차를 어떻게 해결할 수 있는가?
  • RQ3다양한 관절 유형 간 공동 다중 작업 학습이 가림, 흐림, 저해상도 등의 실제 환경에서의 일반화 능력을 향상시키는가?
  • RQ4OpenPose와 같은 다단계, 다중 네트워크 기반 모델 대비 단일 네트워크 접근법이 계산 복잡도와 추론 시간을 얼마나 줄이는가?
  • RQ5다양하고 대규모 데이터셋에서 훈련된 통합 모델이 특화된 얼굴 및 손 검출 네트워크를 능가할 수 있는가?

주요 결과

  • 제안된 단일 네트워크 모델은 사람 수에 관계없이 일정한 실시간 추론이 가능하며, OpenPose는 사람 수에 비례해 성능이 떨어지는 반면 이는 그렇지 않다.
  • 10명의 사람이 있는 이미지에서 이 방법은 OpenPose보다 약 7배 빠르며, 사람 수에 관계없이 추론 시간이 안정되어 있다.
  • 딥 전체 신체 모델은 손 MPII 데이터셋에서 평균 재현율(AR) 97.8%를 달성하여 이전의 OpenPose 단일 척도 모델보다 5.5% 높다.
  • 어려운 실제 환경 이미지에서의 정성적 비교를 통해 저해상도, 흐린, 가림된 얼굴과 손에 대해 더 나은 일반화 능력을 보였다.
  • 단일 단계 공동 훈련 덕분에 훈련 시간이 약 50% 감소하여 별도의 얼굴 및 손 검출기 훈련이 필요 없어졌다.
  • 개선된 성능에도 불구하고 극단적인 가림, 운동 흐림, 매우 작거나 먼 사람에 대해서는 여전히 어려움을 겪으며, 간단한 비가림 자세에서는 OpenPose에 비해 때로는 성능이 열 劣하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.