[논문 리뷰] RTMO: Towards High-Performance One-Stage Real-Time Multi-Person Pose Estimation
RTMO는 YOLO 아키텍처에 이중 1차원 히트맵 기반 좌표 분류를 통합하여 단일 단계 실시간 다수 인명 자세 추정 프레임워크를 제안한다. 동적 좌표 분류기(DCC)와 새로운 최대우도추정(MLE) 기반 손실 함수를 통해 정확도와 효율성을 향상시켰다. COCO val2017에서 74.8%의 AP를 기록하고, 단일 V100 GPU에서 141 FPS를 달성하여 이전의 단일 단계 방법들보다 속도와 정확도 면에서 모두 뛰어난 성능을 보였다.
Real-time multi-person pose estimation presents significant challenges in balancing speed and precision. While two-stage top-down methods slow down as the number of people in the image increases, existing one-stage methods often fail to simultaneously deliver high accuracy and real-time performance. This paper introduces RTMO, a one-stage pose estimation framework that seamlessly integrates coordinate classification by representing keypoints using dual 1-D heatmaps within the YOLO architecture, achieving accuracy comparable to top-down methods while maintaining high speed. We propose a dynamic coordinate classifier and a tailored loss function for heatmap learning, specifically designed to address the incompatibilities between coordinate classification and dense prediction models. RTMO outperforms state-of-the-art one-stage pose estimators, achieving 1.1% higher AP on COCO while operating about 9 times faster with the same backbone. Our largest model, RTMO-l, attains 74.8% AP on COCO val2017 and 141 FPS on a single V100 GPU, demonstrating its efficiency and accuracy. The code and models are available at https://github.com/open-mmlab/mmpose/tree/main/projects/rtmo.
연구 동기 및 목표
- 단일 단계 검출과 정밀한 좌표 분류를 통합하여 실시간 다수 인명 자세 추정에서 속도-정확도 트레이드오���을 해결하고자 한다.
- 직접 키포인트 회귀 방식이 공간적 불확실성 모델링 부족으로 인해 성능이 떨어지는 단일 단계 모델의 한계를 극복하고자 한다.
- 개체별 공간적 맥락에 맞게 적응하는 동적 박스 할당 및 인코딩 메커니즘을 설계하여 히트맵 학습을 향상시키고자 한다.
- 다양한 난이도의 샘플을 균형 있게 최적화할 수 있는 학습 가능한, 샘플 인식 손실 함수를 개발하고자 한다.
- 단일 단계 다수 인명 자세 추정에서 속도와 정확도 면에서 최신 기술 수준의 성능을 달성하고자 한다.
제안 방법
- YOLO 기반 단일 단계 검출기 내부에서 이중 1차원 히트맵을 활용해 키포인트 위치를 추정하고, 직접 회귀 대신 좌표 분류 방식을 도입한다.
- 경계상자 내부에서 박스를 동적으로 할당하고, 학습 가능한 박스 표현을 사용해 국소화 정밀도를 향상시키는 동적 좌표 분류기(DCC)를 제안한다.
- 각 샘플의 불확실성을 학습 가능한 분산으로 모델링하는 최대우도추정(MLE) 기반 손실 함수를 도입하여 다양한 난이도의 개체에 대해 더 나은 최적화를 가능하게 한다.
- 박스 활용도 향상과 공간적으로 일관된 히트맵 출력 보장을 위해 동적 박스 할당(DBA) 및 동적 박스 인코딩(DBE)을 적용한다.
- 정확도 저하를 최소화하면서도 추론 속도를 향상시키기 위해 피처 피라미드에서 P3를 제거하고 P4와 P5만 유지한다.
- CPU 및 GPU 플랫폼에서 효율적인 추론을 위해 ONNXRuntime을 사용해 모델을 훈련 및 배포한다.

실험 결과
연구 질문
- RQ1단일 단계 다수 인명 자세 추정과 같은 고밀도 예측 작업에 좌표 분류를 효과적으로 적용할 수 있는가, 이로 인해 속도가 저하되지 않는가?
- RQ2단일 단계 모델에서 개체별 공간 맥락에 맞게 박스 할당 및 표현을 동적으로 조정할 수 있는가?
- RQ3학습 가능한 불확실성 인식 손실 함수가 표준 쿨백-라이블러(KLD) 분산보다 좌표 히트맵 학습에서 성능을 높이는가?
- RQ4YOLO 기반 모델에 좌표 분류를 통합하면 표준 벤치마크에서 고정확도와 실시간 추론을 동시에 달성할 수 있는가?
- RQ5단일 단계 다수 인명 자세 추정에서 속도와 정확도를 균형 있게 유지하기 위한 최적의 피처 피라미드 구성은 무엇인가?
주요 결과
- RTMO-l은 COCO val2017에서 74.8%의 평균 정밀도(AP)를 기록하여 단일 단계 방법 중 최신 기술 수준을 수립했다.
- RTMO-l는 단일 NVIDIA V100 GPU에서 141 FPS로 실행되어 같은 백본을 사용한 이전 단일 단계 모델보다 약 9배 빠른 추론 속도를 확보했다.
- CrowdPose 벤치마크에서 RTMO-l는 73.2%의 AP를 기록하여 단일 단계 방법 중 최신 기술 수준을 달성했다.
- MLE 기반 손실은 COCO에서 KLD보다 2.1% 높은 AP를 기록하여 각 샘플의 불확실성 모델링의 유용성을 입증했다.
- 피처 피라미드에서 P3를 제거함으로써 헤드 부분의 FLOPs가 78.5% 감소했고 정확도는 0.3% 뿐 감소하여 P4와 P5만으로도 높은 성능을 달성할 수 있음을 증명했다.
- 동적 박스 인코딩(DBE)은 히트맵의 매끄러움과 성능을 크게 향상시켜 고정밀도나 부적절한 인코딩 방식으로 인한 문제를 해결했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.