Skip to main content
QUICK REVIEW

[논문 리뷰] Dite-HRNet: Dynamic Lightweight High-Resolution Network for Human Pose Estimation

Qun Li, Ziyi Zhang|arXiv (Cornell University)|2022. 04. 22.
Human Pose and Action Recognition참고 문헌 23인용 수 9
한 줄 요약

Dite-HRNet는 인간 자세 추정을 위한 동적이고 경량화된 고해상도 네트워크를 제안하며, 동적 분할 컨볼루션(DSC)과 적응형 컨텍스트 모델링(ACM)을 통해 특징 추출 및 장거리 공간적 종속성을 향상시킨다. 이러한 기법들을 특수화된 동적 블록에 통합함으로써, 기존의 경량 네트워크보다 FLOPs와 파라미터 수가 적은 상태에서 COCO 및 MPII 데이터셋에서 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

A high-resolution network exhibits remarkable capability in extracting multi-scale features for human pose estimation, but fails to capture long-range interactions between joints and has high computational complexity. To address these problems, we present a Dynamic lightweight High-Resolution Network (Dite-HRNet), which can efficiently extract multi-scale contextual information and model long-range spatial dependency for human pose estimation. Specifically, we propose two methods, dynamic split convolution and adaptive context modeling, and embed them into two novel lightweight blocks, which are named dynamic multi-scale context block and dynamic global context block. These two blocks, as the basic component units of our Dite-HRNet, are specially designed for the high-resolution networks to make full use of the parallel multi-resolution architecture. Experimental results show that the proposed network achieves superior performance on both COCO and MPII human pose estimation datasets, surpassing the state-of-the-art lightweight networks. Code is available at: https://github.com/ZiyiZhang27/Dite-HRNet.

연구 동기 및 목표

  • 경량 고해상도 네트워크에서 입력에 독립적인 정적 블록의 한계를 해결하기 위해.
  • 계산 복잡도를 증가시키지 않고도 경량 HRNet에서 장거리 공간적 종속성 모델링을 향상시키기 위해.
  • 모델 용량과 효율성 사이의 트레이드오프를 최적화하는 동적이고 적응형 구성 요소를 설계하기 위해.
  • 기존의 경량 아키텍처에 비해 표준 벤치마크(COCO 및 MPII)에서 뛰어난 정확도와 효율성을 달성하기 위해.

제안 방법

  • 다양한 스케일의 특징 추출과 계산 비용 간의 균형을 이루기 위해 채널을 동적으로 분할하고 커널 수를 조절하는 학습 가능한 입력 적응형 컨볼루션 메커니즘인 동적 분할 컨볼루션(DSC)을 제안한다.
  • 특징 맵 전반에 걸친 장거리 종속성을 고려하여 국소 및 전반적인 공간 패턴을 모두 포착하는 학습 가능한 모듈인 적응형 컨텍스트 모델링(ACM)을 도입한다.
  • HRNet의 병렬 다중 해상도 브랜치에 DSC와 ACM을 통합하여 두 가지 새로운 동적 경량 블록—동적 다중 스케일 컨텍스트 블록과 동적 글로벌 컨텍스트 블록—을 설계한다.
  • DSC를 두 가지 초모수—커널 수(N)와 그룹 수(G)—로 구성하며, 각 해상도 브랜치에 맞게 최적화하여 효율성과 정확도를 극대화한다.
  • COCO 및 MPII 데이터셋에서 DSC와 ACM의 개별적 및 통합 기여도를 검증하기 위해 점진적인 추론 분석 전략을 활용한다.
  • 표준 잔차 블록을 대체하는 동적 블록을 포함한 수정된 HRNet 백본을 사용하여 입력에 따라 특징을 학습할 수 있도록 하면서도 고해상도 표현을 유지한다.
Figure 1: Overall architecture of Dite-HRNet. It uses HRNet Sun et al. ( 2019 ) as backbone, adapted by two proposed dynamic blocks. The cross-resolution modules are marked with blue areas.
Figure 1: Overall architecture of Dite-HRNet. It uses HRNet Sun et al. ( 2019 ) as backbone, adapted by two proposed dynamic blocks. The cross-resolution modules are marked with blue areas.

실험 결과

연구 질문

  • RQ1입력에 적응하는 컨볼루션 메커니즘은 인간 자세 추정에서 경량 고해상도 네트워크의 효율성과 정확도를 향상시킬 수 있는가?
  • RQ2FLOPs를 증가시키지 않고도 경량 HRNet에서 장거리 공간적 종속성을 효과적으로 모델링할 수 있는가?
  • RQ3동적 다중 스케일 특징 추출과 적응형 글로벌 컨텍스트 모델링을 결합하면 정적 블록 설계에 비해 성능 향상이 이루어지는가?
  • RQ4동적 블록은 Lite-HRNet와 같은 최신 기술 수준의 경량 네트워크에 비해 더 높은 정확도를 달성하면서도 더 낮은 계산 비용을 갖출 수 있는가?

주요 결과

  • Dite-HRNet-18은 COCO val2017에서 65.9 AP, MPII에서 87.0 PCKh를 기록하여, 파라미터 수 1.1M, FLOPs 209.8 MFLOPs로 경량화된 Lite-HRNet-18(64.8 AP, 86.1 PCKh)을 뛰어넘는 성능을 보였다.
  • ACM과 DSC를 함께 사용한 모델은 COCO에서 65.6 AP, MPII에서 86.7 PCKh를 기록하여 추가적인 FLOPs가 거의 없이도 뚜렷한 정확도 향상을 보였다.
  • Dite-HRNet-18는 COCO에서 87.6 PCKh@0.5로 모든 경량 네트워크 중 최고 성능을 기록하였으며, 파라미터 수와 FLOPs가 더 적은 상태에서 Lite-HRNet-30를 능가했다.
  • 추론 분석 결과, DSC와 ACM 모두 효과적임을 확인하였다: DSC는 다중 스케일 특징 학습을 향상시키고, ACM은 장거리 공간 모델링을 강화하였다.
  • 최적의 DSC 설정은 고해상도에서 저해상도 브랜치로 향하는 순서에서 N = 4,4,2,1 및 G = 1,1,2,4로 설정되었으며, 정확도와 효율성의 균형을 잘 이루었다.
  • Dite-HRNet-18는 MobileNetV2, MobileNetV3, ShuffleNetV2, Small HRNet에 비해 훨씬 낮은 FLOPs와 파라미터 수로도 뛰어난 성능을 달성했다.
Figure 2: Structures of Dynamic Multi-scale Context (DMC) block and Dynamic Global Context (DGC) block. Dynamic Kernel Aggregation (DKA) is applied to Dynamic Split Convolution (DSC) in the DMC block and each convolution in the DGC block. DCM (Dense Context Modeling) and GCM (Global Context Modeling
Figure 2: Structures of Dynamic Multi-scale Context (DMC) block and Dynamic Global Context (DGC) block. Dynamic Kernel Aggregation (DKA) is applied to Dynamic Split Convolution (DSC) in the DMC block and each convolution in the DGC block. DCM (Dense Context Modeling) and GCM (Global Context Modeling

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.