Skip to main content
QUICK REVIEW

[논문 리뷰] Group Pose: A Simple Baseline for End-to-End Multi-person Pose Estimation

Huan Liu, Qiang Chen|arXiv (Cornell University)|2023. 08. 14.
Human Pose and Action RecognitionComputer Science인용 수 3
한 줄 요약

Group Pose는 복잡한 디코더를 대체하기 위해 이중 그룹 자기주의 메커니즘을 도입한 단순하면서도 효과적인 트랜스포머 기반 프레임워크를 제안한다. 이는 인스턴스 내부 및 동일 유형 간의 상호작용을 분리하여, 인간 박스 감독 없이도 MS COCO에서 SOTA 성능을 달성한다. AP는 72.0을 기록하며, 더 복잡한 설계를 가진 이전 방법들을 능가한다.

ABSTRACT

In this paper, we study the problem of end-to-end multi-person pose estimation. State-of-the-art solutions adopt the DETR-like framework, and mainly develop the complex decoder, e.g., regarding pose estimation as keypoint box detection and combining with human detection in ED-Pose, hierarchically predicting with pose decoder and joint (keypoint) decoder in PETR. We present a simple yet effective transformer approach, named Group Pose. We simply regard $K$-keypoint pose estimation as predicting a set of $N imes K$ keypoint positions, each from a keypoint query, as well as representing each pose with an instance query for scoring $N$ pose predictions. Motivated by the intuition that the interaction, among across-instance queries of different types, is not directly helpful, we make a simple modification to decoder self-attention. We replace single self-attention over all the $N imes(K+1)$ queries with two subsequent group self-attentions: (i) $N$ within-instance self-attention, with each over $K$ keypoint queries and one instance query, and (ii) $(K+1)$ same-type across-instance self-attention, each over $N$ queries of the same type. The resulting decoder removes the interaction among across-instance type-different queries, easing the optimization and thus improving the performance. Experimental results on MS COCO and CrowdPose show that our approach without human box supervision is superior to previous methods with complex decoders, and even is slightly better than ED-Pose that uses human box supervision. $\href{https://github.com/Michel-liu/GroupPose-Paddle}{ m Paddle}$ and $\href{https://github.com/Michel-liu/GroupPose}{ m PyTorch}$ code are available.

연구 동기 및 목표

  • 복잡한 디코더를 경량의 쿼리 기반 트랜스포머 설계로 대체하여 엔드 투 엔드 다중 인원 자세 추정을 단순화한다.
  • 기본 자기주의에서 유용하지 않은 타입 간 쿼리 상호작용을 제거함으로써 최적화 및 성능을 향상시킨다.
  • 인간 검출 감독 없이도 높은 추론 속도를 유지하면서도 뛰어난 정확도를 달성한다.
  • 단독으로 사용하거나 인간 검출 헤드와 통합하여 사용할 수 있는 유연하고 확장 가능한 기초 모델을 제공한다.

제안 방법

  • 모델은 $N \times K$개의 키포인트 쿼리와 $N$개의 인스턴스 쿼리를 사용하여 각각 $K$개의 키포인트를 가진 $N$개의 인간 자세를 예측한다.
  • 표준 디코더 자기주의를 두 단계의 그룹 자기주의로 대체한다: (i) $K$개의 키포인트 쿼리와 하나의 인스턴스 쿼리에 대해 $N$개의 인스턴스 내부 자기주의를 수행하고, (ii) 동일한 타입의 $N$개 쿼리에 대해 $(K+1)$개의 인스턴스 간 자기주의를 수행한다.
  • 이 설계는 각 사람의 운동학적 관계를 명시적으로 모델링하고, 인스턴스 간 중복 예측을 집계하지만, 생산적이지 않은 타입 간 상호작용을 방지한다.
  • 비가역적인 후처리가 필요 없이 표준 트랜스포머 손실을 사용해 엔드 투 엔드로 훈련된다.
  • 단독 훈련과 인간 검출 디코더 통합을 통해 초기화를 향상시킬 수 있다.
  • 코드는 Paddle 및 PyTorch 모두에서 구현되었으며, 공개적으로 배포되었다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 다중 인원 자세 추정에서 더 단순한 트랜스포머 디코더 설계가 복잡한 다중 헤드 디코더를 능가할 수 있는가?
  • RQ2자기주의에서 타입 간 쿼리 상호작용을 제거하면 최적화와 성능이 향상되는가?
  • RQ3쿼리 기반 접근 방식이 인간 박스 감독 없이도 SOTA 성능을 달성할 수 있는가?
  • RQ4기존 엔드 투 엔드 프레임워크와 비교해 모델의 추론 속도는 어떻게 되는가?
  • RQ5인스턴스 쿼리 초기화가 수렴성과 정확도에 어떤 영향을 미치는가?

주요 결과

  • ResNet-50 백본을 사용해 MS COCO val2017에서 Group Pose는 72.0 AP를 달성했으며, 인간 박스 감독을 사용하는 ED-Pose를 능가한다.
  • Swin-Large 백본을 사용할 경우 Group Pose는 MS COCO에서 74.8 AP를 기록하여 대규모 모델에서도 뛰어난 성능을 보였다.
  • 단일 A100 GPU에서 480×800 해상도에서는 실시간 추론 속도 68.6 FPS, 800×1333 해상도에서는 31.3 FPS를 기록했다.
  • 절단 실험 결과, 타입 간 상호작용을 제거함으로써 최적화가 향상되었으며, 인간 검출 디코더 없이도 ED-Pose보다 더 빠르게 수렴하고 더 높은 정확도를 달성했다.
  • 인간 검출 초기화를 통해 수렴성이 향상되었으며, 60 에포크에서 72.2 AP로 성능이 향상되었다.
  • 100개의 인간 인스턴스로도 충분하며, 200개로 늘려도 유의미한 성능 향상이 없어, 모델의 인스턴스 수 효율성이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.