Skip to main content
QUICK REVIEW

[논문 리뷰] Effective Whole-body Pose Estimation with Two-stages Distillation

Zhendong Yang, Ailing Zeng|arXiv (Cornell University)|2023. 07. 29.
Human Pose and Action RecognitionComputer Science인용 수 3
한 줄 요약

이 논문은 효과적이고 효율적인 전신 인체 자세 추정을 위한 이단계 지식 정복 프레임워크인 DWPose를 제안한다. 첫 번째 단계에서 교사 모델(RTMPose-x)의 중간 특징과 완전한 관점 키포인트 로짓을 활용하고, 두 번째 단계에서 경량의 헤드 인식 자가정복을 적용함으로써 총 학습 시간의 20%만으로도 RTMPose-l의 COCO-WholeBody AP를 64.8%에서 66.5%로 향상시켰으며, 이는 교사 모델를 초월하는 성능을 달성하였다.

ABSTRACT

Whole-body pose estimation localizes the human body, hand, face, and foot keypoints in an image. This task is challenging due to multi-scale body parts, fine-grained localization for low-resolution regions, and data scarcity. Meanwhile, applying a highly efficient and accurate pose estimator to widely human-centric understanding and generation tasks is urgent. In this work, we present a two-stage pose extbf{D}istillation for extbf{W}hole-body extbf{P}ose estimators, named extbf{DWPose}, to improve their effectiveness and efficiency. The first-stage distillation designs a weight-decay strategy while utilizing a teacher's intermediate feature and final logits with both visible and invisible keypoints to supervise the student from scratch. The second stage distills the student model itself to further improve performance. Different from the previous self-knowledge distillation, this stage finetunes the student's head with only 20% training time as a plug-and-play training strategy. For data limitations, we explore the UBody dataset that contains diverse facial expressions and hand gestures for real-life applications. Comprehensive experiments show the superiority of our proposed simple yet effective methods. We achieve new state-of-the-art performance on COCO-WholeBody, significantly boosting the whole-body AP of RTMPose-l from 64.8% to 66.5%, even surpassing RTMPose-x teacher with 65.3% AP. We release a series of models with different sizes, from tiny to large, for satisfying various downstream tasks. Our codes and models are available at https://github.com/IDEA-Research/DWPose.

연구 동기 및 목표

  • 실세계의 인간 중심 응용을 위한 전신 자세 추정의 정확도와 효율성을 향상시키기 위해.
  • 손과 얼굴과 같은 세밀한 신체 부위의 데이터 부족 문제를 UBody와 같은 정제된 데이터셋을 통해 해결하기 위해.
  • 추가적인 추론 비용 없이 경량 모델의 성능을 향상시키는 즉시 적용 가능한 정복 전략을 개발하기 위해.
  • 제어 가능한 이미지 생성과 같은 후행 작업을 위한 고품질 자세 추정을 가능하게 하기 위해.
  • 기존 모델을 뛰어넘는 성능을 달성하면서도 실시간 추론 속도를 유지하기 위해.

제안 방법

  • 첫 번째 단계 정복은 교사 모델의 최종 로짓과 중간 특징에서 유추된 가시 및 비가시 키포인트 감독을 모두 활용하며, 학습 안정성을 향상시키기 위해 감쇠하는 정복 가중치를 사용한다.
  • 새로운 가중치 감쇠 전략을 도입하여 정복 손실의 영향을 점차 줄여 학습 안정성과 일반화 능력을 향상시킨다.
  • 두 번째 단계 자가지식 정복은 냉각된 학생 백본과 두 번째 학생을 교사로 삼아 학생의 헤드만 미세조정하며, 총 학습 시간의 20%만으로도 수행된다.
  • 대상 마스크 없이 로짓 기반 정복을 적용함으로써, 비가시 키포인트에 대한 교사 지식 유지를 통해 실증적으로 성능 향상을 이룬다.
  • 이 방법은 즉시 적용 가능하며, 어떤 조밀한 예측 헤드와도 호환되어 광범위한 적용 가능성을 지닌다.
  • 다양한 표정과 손 동작을 다루는 일반화 능력을 향상시키기 위해 UBody 데이터셋을 통합하여 실제 적용 가능성 향상에 기여한다.

실험 결과

연구 질문

  • RQ1두 단계 정복 프레임워크는 추론 비용을 증가시키지 않고도 경량 전신 자세 추정기의 정확도를 크게 향상시킬 수 있는가?
  • RQ2교사 모델의 가시 및 비가시 키포인트 감독을 동시에 활용할 경우, 전신 자세 추정에서 학생 모델의 성능에 어떤 영향을 미치는가?
  • RQ3경량의 헤드 인식 자가정복 전략은 최소한의 추가 학습 시간으로 얼마나 모델 정확도를 향상시킬 수 있는가?
  • RQ4UBody와 같은 다양한 실제 환경 데이터를 통합할 경우, 세밀한 신체 부위에서의 자세 추정기의 강건성과 일반화 능력은 어떻게 향상되는가?
  • RQ5더 정확한 자세 추정기로 제어 가능한 이미지 생성 품질을 향상시킬 수 있는가? 이때 생성 모델의 재학습 없이도 가능할까?

주요 결과

  • DWPose는 COCO-WholeBody에서 새로운 SOTA 전신 AP 66.5%를 달성하여 RTMPose-l의 64.8%를 크게 향상시켰다.
  • RTMPose-x 교사 모델(65.3% AP)을 초월하는 성능을 달성하여 정복 파이프라인의 효과성을 입증하였다.
  • 두 번째 단계 자가정복은 총 학습 시간의 20%만으로도 성능 향상을 이끌어내어 매우 효율적인 즉시 적용 가능한 전략임을 입증하였다.
  • 로짓 기반 정복에서 대상 마스크를 제거할 경우 1.1%의 성능 저하가 발생하여, 모든 키포인트(비가시 키포인트 포함)에 대한 완전한 감독이 지식 전이에 필수적임을 입증하였다.
  • DWPose는 이미지당 추론 시간을 0.068초로 단축시켰으며(OpenPose 대비 5.78초), 다수의 사람에 대해서도 잘 스케일링되어 고도의 저지연을 유지한다.
  • 이미지 생성 작업에서 DWPose는 ControlNet과 함께 사용했을 때 OpenPose보다 더 정밀한 스켈레톤 감독을 제공하여 훨씬 더 높은 품질의 결과를 도출하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.