Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Trainable Multi-Instance Pose Estimation with Transformers

Lucas Stoffl, Maxime Vidal|arXiv (Cornell University)|2021. 03. 22.
Human Pose and Action Recognition참고 문헌 47인용 수 11
한 줄 요약

이 논문은 하나의 순방향 전파에서 다수의 개인에 대한 키포인트 집합을 직접 예측하는 트랜스포머 기반 인코더-디코더 아키텍처를 사용하는 엔드 투 엔드 훈련 가능한 다중 인스턴스 자세 추정 모델인 POET을 제안한다. 자세 추정을 새로운 세트 기반 손실과 이항 매칭을 사용한 세트 예측 문제로 공식화함으로써, COCO에서 최신 기준 성능을 달성하면서도 기존의 상위 다운 및 바텀 업 방법보다 빠르고 파라미터 효율성이 뛰어나며, 전이 학습을 통한 동물 자세 추정으로의 일반화 능력도 뛰어나다.

ABSTRACT

We propose an end-to-end trainable approach for multi-instance pose estimation, called POET (POse Estimation Transformer). Combining a convolutional neural network with a transformer encoder-decoder architecture, we formulate multiinstance pose estimation from images as a direct set prediction problem. Our model is able to directly regress the pose of all individuals, utilizing a bipartite matching scheme. POET is trained using a novel set-based global loss that consists of a keypoint loss, a visibility loss and a class loss. POET reasons about the relations between multiple detected individuals and the full image context to directly predict their poses in parallel. We show that POET achieves high accuracy on the COCO keypoint detection task while having less parameters and higher inference speed than other bottom-up and top-down approaches. Moreover, we show successful transfer learning when applying POET to animal pose estimation. To the best of our knowledge, this model is the first end-to-end trainable multi-instance pose estimation method and we hope it will serve as a simple and promising alternative.

연구 동기 및 목표

  • 후처리 또는 이중 단계 네트워크가 필요 없이 엔드 투 엔드 훈련 가능한 다중 인스턴스 자세 추정 방법을 개발하기 위해.
  • 기존의 상위 다운 및 바텀 업 접근 방식의 한계를 해결하기 위해, 이는 엔드 투 엔드 훈련이 불가능하고 복잡한 후처리가 필요하기 때문이다.
  • 트랜스포머와 이항 매칭을 사용하여 다중 인스턴스 자세 추정을 직접적인 세트 예측 문제로 공식화하기 위해.
  • 어려운 벤치마크인 COCO에서 높은 정확도를 유지하면서 추론 속도와 모델 효율성을 향상시키기 위해.
  • 모델의 소수의 샘플 및 도메인 이동 설정(예: 동물 자세 추정)으로의 전이 가능성 증명하기 위해.

제안 방법

  • POET은 복소 신경망 백본과 트랜스포머 인코더-디코더 아키텍처를 결합하여 하나의 순방향 전파에서 다수의 개인 자세를 예측한다.
  • 각 예측 자세는 중심 좌표, 각 키포인트에 대한 상대 오프셋, 가시성 점수를 포함한 벡터로 표현된다.
  • 예측을 지도하기 위해 키포인트 회귀 손실, 가시성 손실, 클래스 손실을 조합한 새로운 세트 기반 전역 손실 함수를 사용한다.
  • 훈련 중에 예측된 자세와 진짜 자세 간의 이항 매칭을 적용하여 가장 가까운 예측을 진짜 인스턴스에 할당한다.
  • 손실는 미분 가능하며 엔드 투 엔드 역전파를 가능하게 하여 모델이 개인과 이미지 컨텍스트의 공동 표현을 학습할 수 있도록 한다.
  • 아키텍처는 DETR를 영감으로 삼았지만, 학습 가능한 중심 표현과 상대 오프셋 예측을 도입하여 키포인트 예측에 적합하게 변형되었다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 아키텍처가 후처리 또는 이중 단계 네트워크 없이 다중 인스턴스 자세 추정에 엔드 투 엔드 훈련을 달성할 수 있는가?
  • RQ2이항 매칭을 통한 제안된 세트 기반 손실이 표준 회귀 손실에 비해 정확도와 일반화 능력을 어떻게 향상시키는가?
  • RQ3COCO에서 미리 훈련된 모델이 제한된 데이터로 다른 도메인(예: 동물 자세 추정)으로 얼마나 잘 일반화되는가?
  • RQ4중심 손실과 델타 손실 구성 요소가 키포인트 정렬 정확도에 미치는 영향은 무엇인가?
  • RQ5기존의 상위 다운 및 바텀 업 방법과 비교해 모델의 추론 속도가 이미지 내 사람 수에 따라 어떻게 변화하는가?

주요 결과

  • POET는 COCO 키포인트 검증 세트에서 48.5 mAP를 달성하여, 더 높은 입력 해상도를 사용함에도 불구하고 베이스라인 모델을 능가한다.
  • 경량 바텀 업 및 상위 다운 방법보다 빠르며, 이미지 내 사람 수에 관계없이 추론 속도가 일정하다.
  • COCO에서 미리 훈련한 모델을 사용한 전이 학습으로 MacaquePose에서 77.1 mAP를 달성하여, ResNet-50 + 어노테이션 임베딩 기반 베이스라인을 크게 능가한다.
  • 제거 실험 결과, 중심 손실과 델타 손실 구성 요소가 매우 중요하며, 전체 손실 설정이 가장 높은 성능을 낸다.
  • 절대 좌표 없이 상대 오프셋과 중심 손실만 사용해 훈련한 모델는 250 에포크 후 35.5 mAP를 기록하여 전체 모델의 48.5 mAP에 못 미친다.
  • 어텐션 시각화 결과, 트랜스포머가 개인 간 관계와 전반적인 이미지 컨텍스트에 주목하고 있음을 확인하여, 자세 그룹화에 대한 추론 능력을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.