Skip to main content
QUICK REVIEW

[논문 리뷰] EfficientHRNet: Efficient Scaling for Lightweight High-Resolution Multi-Person Pose Estimation

Christopher Neff, Aneri Sheth|arXiv (Cornell University)|2020. 07. 15.
Human Pose and Action Recognition인용 수 15
한 줄 요약

EfficientHRNet는 실시간 하단에서 상향식 다중 인명 2D 인간 자세 추정을 위한 가벼운 확장 가능한 고해상도 네트워크 가족을 소개한다. EfficientNet에서 영감을 받은 복합 스케일링 전략을 사용하여 입력 해상도, 백본 네트워크, 고해상도 특징 스트림을 동시에 스케일링함으로써 HigherHRNet에 비해 모델 크기를 1/3으로 줄이고 계산량을 1/6으로 줄이며 최고 성능을 달성한다. NVIDIA Jetson Xavier에서 23 FPS로 실행된다.

ABSTRACT

There is an increasing demand for lightweight multi-person pose estimation for many emerging smart IoT applications. However, the existing algorithms tend to have large model sizes and intense computational requirements, making them ill-suited for real-time applications and deployment on resource-constrained hardware. Lightweight and real-time approaches are exceedingly rare and come at the cost of inferior accuracy. In this paper, we present EfficientHRNet, a family of lightweight multi-person human pose estimators that are able to perform in real-time on resource-constrained devices. By unifying recent advances in model scaling with high-resolution feature representations, EfficientHRNet creates highly accurate models while reducing computation enough to achieve real-time performance. The largest model is able to come within 4.4% accuracy of the current state-of-the-art, while having 1/3 the model size and 1/6 the computation, achieving 23 FPS on Nvidia Jetson Xavier. Compared to the top real-time approach, EfficientHRNet increases accuracy by 22% while achieving similar FPS with 1/3 the power. At every level, EfficientHRNet proves to be more computationally efficient than other bottom-up 2D human pose estimation approaches, while achieving highly competitive accuracy.

연구 동기 및 목표

  • 자원 제약이 있는 IoT 및 엣지 디바이스에 적합한 경량 실시간 하단에서 상향식 다중 인명 2D 자세 추정 방법의 부족을 해결한다.
  • 기존의 경량 자세 추정 접근 방식에서 모델 효율성과 정확도 사이의 상충 관계를 극복한다.
  • 계산 비용과 모델 크기를 크게 줄이면서도 높은 정확도를 유지하는 확장 가능한 아키텍처를 개발한다.
  • NVIDIA Jetson Xavier와 같은 저전력 엣지 하드웨어에서 실시간 추론을 가능하게 하여 지속적인 모니터링 응용을 지원한다.
  • 실세계 배포에서 다양한 정확도 및 효율성 요구 사항을 충족시킬 수 있는 유연한 모델 패밀리를 제공한다.

제안 방법

  • EfficientNet의 복합 스케일링 방법을 하단에서 상향식 자세 추정에 적용하여 입력 해상도, 백본 네트워크, 고해상도 특징 네트워크를 통합적으로 스케일링한다.
  • 모든 특징 추출 단계에서 공간적 세부 정보를 유지하기 위해 HRNet의 고해상도 특징 표현 메커니즘을 통합한다.
  • 다중 해상도 특징 융합 전략을 사용하여 네트워크 전반에 걸쳐 고해상도 표현을 유지함으로써 관절점 정확도를 향상시킨다.
  • 스케일링 계수 φ를 변화시켜 H₀에서 H₋₄까지의 확장 가능한 모델 패밀리(H₀ to H₋₄)를 설계함으로써 정확도와 효율성 간의 트레이드오프를 가능하게 한다.
  • COCO 데이터셋에서 경쟁적인 성능를 유지하면서도 FLOPs와 파라미터를 줄이기 위해 네트워크 아키텍처를 최적화한다.
  • ImageNet에서 백본 변종을 독립적으로 평가하여 일반화 능력과 효율성 향상 여부를 검증한다.

실험 결과

연구 질문

  • RQ1하나의 복합 스케일링 전략을 하단에서 상향식 자세 추정에 효과적으로 적용하여 모델 크기, FLOPs, 추론 시간을 동시에 줄이면서도 높은 정확도를 유지할 수 있는가?
  • RQ2입력 해상도, 백본, 고해상도 특징 네트워크의 공동 스케일링이 개별 스케일링과 비교해 관절점 검출 성능에 어떤 영향을 미치는가?
  • RQ3경량 HRNet 기반 아키텍처가 얼마나 높은 정확도를 달성할 수 있으며, 엣지 디바이스에서 실시간 추론을 가능하게 할 수 있는가?
  • RQ4정확도, 속도, 에너지 효율성 측면에서 기존의 경량 및 최고 성능 자세 추정 모델과 비교해 EfficientHRNet의 성능는 어떠한가?
  • RQ5EfficientHRNet 모델 패밀리 전반에서 모델 크기, 추론 속도, 정확도 사이의 트레이드오프는 어떠한가?

주요 결과

  • 가장 큰 EfficientHRNet 모델(H₀)은 COCO2017 검증 세트에서 64.8 AP를 달성하여 최고 성능인 HigherHRNet에 비해 4.4% 이내의 성능를 유지하면서도 모델 크기를 1/3으로 줄이고 계산량을 1/6으로 감소시켰다.
  • EfficientHRNet는 NVIDIA Jetson Xavier NX에서 23 FPS를 기록하여 저전력 엣지 디바이스에서 실시간 추론을 가능하게 했다.
  • 최고의 실시간 방법인 Lightweight OpenPose와 비교해 EfficientHRNet는 정확도를 10.1% 향상시키면서도 계산량을 15% 줄였고, 전력 소비를 1/3으로 줄였다.
  • HigherHRNet 및 PersonLab에 비해 FLOPs를 83–93% 감소시켰으며, 67.1–64.8 AP의 정확도를 유지함으로써 FPS를 3.4배로 증가시켰다.
  • 가장 작은 모델(H₋₄)은 35.7 AP를 기록하며 50.96 FPS와 3.397의 효율성 점수를 확보하여 단순한 시나리오에서 수용 가능한 정확도를 제공하는 고도로 제약된 디바이스에 배포할 수 있었다.
  • 정성적 분석 결과, H₀는 최고 성능 모델과 거의 동시에 작동하는 것으로 나타났으며, 더 작은 변종(H₋₁에서 H₋₄)은 관절점 검출에 있어서 정확도를 유지하지만 복잡한 장면에서는 그룹화를 위해 후처리가 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.