Skip to main content
QUICK REVIEW

[논문 리뷰] QueryPose: Sparse Multi-Person Pose Regression via Spatial-Aware Part-Level Query

Yabo Xiao, Kai Su|arXiv (Cornell University)|2022. 12. 15.
Human Pose and Action Recognition인용 수 9
한 줄 요약

QueryPose는 이미지에서 키포인트 좌표를 직접 회귀하기 위해 공간 인식형 파트 수준 쿼리를 사용하는 희소이고 엔드 투 엔드인 다수 인물 자세 추정 프레임워크를 제안한다. 이는 밀도 높은 히트맵과 수작업으로 만든 후처리를 제거한다. 공간 파트 임베딩 생성 모듈(SPEGM)과 선택적 반복 모듈(SIM)을 도입함으로써, MS COCO mini-val에서 73.6 AP, CrowdPose에서 72.7 AP를 기록하며 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We propose a sparse end-to-end multi-person pose regression framework, termed QueryPose, which can directly predict multi-person keypoint sequences from the input image. The existing end-to-end methods rely on dense representations to preserve the spatial detail and structure for precise keypoint localization. However, the dense paradigm introduces complex and redundant post-processes during inference. In our framework, each human instance is encoded by several learnable spatial-aware part-level queries associated with an instance-level query. First, we propose the Spatial Part Embedding Generation Module (SPEGM) that considers the local spatial attention mechanism to generate several spatial-sensitive part embeddings, which contain spatial details and structural information for enhancing the part-level queries. Second, we introduce the Selective Iteration Module (SIM) to adaptively update the sparse part-level queries via the generated spatial-sensitive part embeddings stage-by-stage. Based on the two proposed modules, the part-level queries are able to fully encode the spatial details and structural information for precise keypoint regression. With the bipartite matching, QueryPose avoids the hand-designed post-processes and surpasses the existing dense end-to-end methods with 73.6 AP on MS COCO mini-val set and 72.7 AP on CrowdPose test set. Code is available at https://github.com/buptxyb666/QueryPose.

연구 동기 및 목표

  • 밀도 높은 엔드 투 엔드 다수 인물 자세 추정에서 복잡하고 비가역적인 후처리 단계를 제거하기 위해.
  • 인스턴스 수준 쿼리의 국소적 공간적 세부 정보 및 구조적 정보를 포착하는 데 한계가 있는 문제를 해결하기 위해.
  • 공간적 구조와 국소적 특징을 유지하는 희소이고 학습 가능한 쿼리 기반 프레임워크를 개발하여 키포인트 정렬을 향상시키기 위해.
  • 희소 쿼리 기반 회귀가 밀도 높은 히트맵 기반 방법보다 다수 인물 자세 추정에서 뛰어나다는 것을 입증하기 위해.
  • 보조 히트맵 감독 없이도 복잡하고 혼잡한 환경에서 공간 인식형 파트 수준 쿼리의 효과성을 검증하기 위해.

제안 방법

  • 국소적 공간적 특징과 구조적 맥락을 인코딩하기 위해 반복적으로 학습되고 업데이트되는 공간 인식형 파트 수준 쿼리를 도입한다.
  • 국소적 공간적 어텐션을 사용하여 특징 맵에서 공간 민감한 파트 임베딩을 생성하는 공간 파트 임베딩 생성 모듈(SPEGM)을 제안한다.
  • 생성된 공간 민감한 임베딩을 사용하여 단계별로 파트 수준 쿼리를 적응적으로 개선하는 선택적 반복 모듈(SIM)을 활용한다.
  • 비가역적인 후처리(예: NMS)를 피하기 위해 이중 매칭을 사용하여 엔드 투 엔드 학습 및 추론을 수행한다.
  • 쿼리 개선 및 회귀를 위한 특징 추출을 위해 트랜스포머 기반 백본(예: Swin-Large 또는 HRNet-W48)을 활용한다.
  • 순수하게 가역적인 방식으로 모델을 학습시켜 중간 단계의 히트맵 없이도 키포인트 좌표를 직접적으로 회귀한다.

실험 결과

연구 질문

  • RQ1희소이고 학습 가능한 쿼리 기반 프레임워크가 다수 인물 자세 추정에서 밀도 높은 히트맵 표현을 효과적으로 대체할 수 있는가?
  • RQ2공간 인식형 파트 수준 쿼리는 인스턴스 수준 쿼리보다 국소 세부 정보와 구조적 관계를 더 잘 포착할 수 있는가?
  • RQ3제안된 SPEGM과 SIM 모듈 조합이 기존 엔드 투 엔드 방법보다 키포인트 정렬 정확도를 향상시키는가?
  • RQ4보조 히트맵 감독 없이도 희소 회귀 프레임워크가 밀도 높은 엔드 투 엔드 방법보다 뛰어나게 성능을 내는가?
  • RQ5희소 쿼리 접근 방식은 NMS 기반의 밀도 높은 방법에 비해 혼잡한 환경에서 어떻게 성능을 내는가?

주요 결과

  • QueryPose는 MS COCO mini-val 세트에서 73.6 AP를 기록하여 기존의 모든 밀도 높은 엔드 투 엔드 방법을 능가한다.
  • CrowdPose 테스트 세트에서 QueryPose는 72.7 AP를 기록하여 현재 최신 기술 수준의 엔드 투 엔드 방법을 초월한다.
  • HRNet-W48를 사용할 경우 CrowdPose에서 72.1 AP, Swin-Large를 사용할 경우 72.7 AP를 기록하여 혼잡한 환경에서도 뛰어난 일반화 성능을 입증한다.
  • 기존의 회귀 기반 방법들과 달리, QueryPose는 학습 중에 온라인 보조 히트맵 학습이 필요 없음에도 불구하고 높은 성능을 달성한다.
  • 제거 분석 결과, SPEGM과 SIM 모듈이 국소적 공간 세부 정보를 포착하고 키포인트 정확도를 향상시키는 데 필수적이라는 것이 확인된다.
  • 희소 파라디그마는 NMS로 인해 발생하는 문제(예: 겹치는 키포인트나 인스턴스 제거)를 피할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.