Skip to main content
QUICK REVIEW

[논문 리뷰] 3D-MuPPET: 3D Multi-Pigeon Pose Estimation and Tracking

Urs Waldmann, Alex Hoi Hang Chan|arXiv (Cornell University)|2023. 08. 29.
Animal Behavior and Welfare Studies인용 수 7
한 줄 요약

3D-MuPPET는 다중 카메라를 이용한 실시간 3D 다중 비둘기 자세 추정 및 추적을 위한 새로운 프레임워크로, 2D 관점에서의 키포인트 검출과 삼각측량, 다중 시점 간의 신원 추적을 통합한다. 2D에서는 최대 9.45 fps, 3D에서는 1.89 fps의 성능을 기록하며 최신 기술 수준과 유사한 정확도를 확보하고 있으며, 추가 애너테이션 없이도 실외 환경으로의 일반화가 효과적으로 이루어져 집단 동물 행동 연구를 위한 확장 가능한 3D 자세 추적을 가능하게 한다.

ABSTRACT

Markerless methods for animal posture tracking have been rapidly developing recently, but frameworks and benchmarks for tracking large animal groups in 3D are still lacking. To overcome this gap in the literature, we present 3D-MuPPET, a framework to estimate and track 3D poses of up to 10 pigeons at interactive speed using multiple camera views. We train a pose estimator to infer 2D keypoints and bounding boxes of multiple pigeons, then triangulate the keypoints to 3D. For identity matching of individuals in all views, we first dynamically match 2D detections to global identities in the first frame, then use a 2D tracker to maintain IDs across views in subsequent frames. We achieve comparable accuracy to a state of the art 3D pose estimator in terms of median error and Percentage of Correct Keypoints. Additionally, we benchmark the inference speed of 3D-MuPPET, with up to 9.45 fps in 2D and 1.89 fps in 3D, and perform quantitative tracking evaluation, which yields encouraging results. Finally, we showcase two novel applications for 3D-MuPPET. First, we train a model with data of single pigeons and achieve comparable results in 2D and 3D posture estimation for up to 5 pigeons. Second, we show that 3D-MuPPET also works in outdoors without additional annotations from natural environments. Both use cases simplify the domain shift to new species and environments, largely reducing annotation effort needed for 3D posture tracking. To the best of our knowledge we are the first to present a framework for 2D/3D animal posture and trajectory tracking that works in both indoor and outdoor environments for up to 10 individuals. We hope that the framework can open up new opportunities in studying animal collective behaviour and encourages further developments in 3D multi-animal posture tracking.

연구 동기 및 목표

  • 실내 및 실외 환경에서 3D 다중 동물 자세 추정 및 추적을 위한 프레임워크의 부족을 보완하기 위해.
  • 다중 시점 카메라 설정을 활용해 최대 10只의 비둘기까지 상호작용 수준의 속도로 3D 자세 추정 및 궤적 추적을 가능하게 하기 위해.
  • 실내 데이터에서 학습한 모델을 실외 환경 및 다중 개체 데이터로 일반화함으로써 애너테이션 작업을 최소화하기 위해.
  • 3D-POP 데이터셋을 활용해 3D 다중 동물 자세 추정 및 추적에 대한 벤치마크를 제공하기 위해.
  • 단일 동물에 대해 학습된 2D 자세 추정 모델을 다중 개체 추적에 적용했을 때 성능 저하를 최소화하면서도 실현 가능성을 입증하기 위해.

제안 방법

  • 2D 자세 추정기인 KeypointRCNN 기반 모델이 다중 카메라 시점에서 다수의 비둘기 키포인트와 바운딩 박스를 검출한다.
  • 다중 시점에서의 2D 키포인트 검출 결과를 삼각측량을 통해 3D 자세로 재구성한다.
  • 초기 프레임에서 전역 신원과의 2D 검출 매칭을 통해 신원 할당을 수행한 후, 이후 프레임에서는 SORT 추적기로 지속적인 추적을 수행한다.
  • 3D 자세 추정의 정확도를 향상시키고 시간적 일관성을 높이기 위해 칼만 필터를 사용한다.
  • 단일 비둘기 데이터로 학습한 후, 재학습 없이도 다중 비둘기 및 실외 환경으로의 일반화를 지원함으로써 도메인 일반화를 구현한다.
  • 3D-POP 데이터셋 기반으로 정량적 평가 지표인 중앙값 오차, 정확한 키포인트 비율(PCK), 다중 객체 추적 지표를 사용해 시스템을 평가한다.

실험 결과

연구 질문

  • RQ1단일 비둘기 데이터로 학습된 2D 자세 추정 모델이 다중 비둘기 추적에 적용되었을 때, 3D 자세 정확도가 유사한 성능을 보일 수 있는가?
  • RQ2실내 실험실 데이터로 학습된 3D 자세 추정 프레임워크가 추가 애너테이션 없이도 실외 현장 데이터에 성공적으로 적용될 수 있는가?
  • RQ33D-MuPPET의 추론 속도와 정확도는 다중 비둘기 상황에서 최신 기술 수준의 3D 자세 추정기와 비교해 어떻게 되는가?
  • RQ4신원 추적 파이프라인은 다중 카메라 및 시간 경과에 걸쳐 일관된 ID 유지에 얼마나 효과적인가?
  • RQ5이 프레임워크는 실시간, 상호작용 수준의 속도로 3D 다중 동물 자세 추정 및 추적을 얼마나 잘 지원하는가?

주요 결과

  • 3D-MuPPET는 3D-POP 데이터셋에서 2D 중앙값 오차 1.85 mm, 3D 중앙값 오차 2.98 mm를 기록하며 최신 기술 수준의 성능을 확보한다.
  • 2D 추론 시 9.45 fps, 3D 추론 시 1.89 fps의 성능을 기록하여 상호작용 수준의 추적을 가능하게 한다.
  • 단일 비둘기 데이터로 학습된 모델을 사용함으로써 최대 5只의 비둘기까지 유사한 2D 및 3D 자세 추정 정확도를 확보하였으며, 애너테이션 필요성을 줄였다.
  • 추가 애너테이션 없이도 실외 환경으로의 일반화가 효과적으로 이루어져 도메인 이동에 대한 강건성을 입증하였다.
  • 3D-POP 데이터셋 기반 정량적 추적 평가에서 다중 객체 추적 정밀도 및 재현율 측면에서 유망한 성능을 보였다.
  • KeypointRCNN를 2D 자세 추정에 적용함으로써 3D-ViTPose보다 빠른 추론 속도를 확보하여 속도가 중요한 응용 분야에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.