Skip to main content
QUICK REVIEW

[논문 리뷰] SimCC: a Simple Coordinate Classification Perspective for Human Pose Estimation

Yanjie Li, Sen Yang|arXiv (Cornell University)|2021. 07. 07.
Human Pose and Action Recognition인용 수 11
한 줄 요약

이 논문은 2D 히트맵 기반 인간 자세 추정(HPE) 방법에서 오랫동안 지속된 양자화 오차 문제를 해결하기 위해 간단한 좌표 분류 프레임워크인 SimCC를 제안한다. 이는 키포인트 위치를 x-좌표와 y-좌표에 대한 두 개의 독립적인 1차원 분류 작업으로 재구성한다. 각 픽셀을 균일하게 하위 픽셀 박스로 나누어, 최소한의 양자화 오차로 하위 픽셀 정밀도를 달성함으로써, 고비용의 업샘플링 레이어와 후처리 단계가 필요 없도록 한다. 이는 특히 저해상도 입력에서 히트맵 기반 방법보다 뛰어난 성능을 보이며, FLOPs를 55% 이상 감소시킨다.

ABSTRACT

The 2D heatmap-based approaches have dominated Human Pose Estimation (HPE) for years due to high performance. However, the long-standing quantization error problem in the 2D heatmap-based methods leads to several well-known drawbacks: 1) The performance for the low-resolution inputs is limited; 2) To improve the feature map resolution for higher localization precision, multiple costly upsampling layers are required; 3) Extra post-processing is adopted to reduce the quantization error. To address these issues, we aim to explore a brand new scheme, called extit{SimCC}, which reformulates HPE as two classification tasks for horizontal and vertical coordinates. The proposed SimCC uniformly divides each pixel into several bins, thus achieving \emph{sub-pixel} localization precision and low quantization error. Benefiting from that, SimCC can omit additional refinement post-processing and exclude upsampling layers under certain settings, resulting in a more simple and effective pipeline for HPE. Extensive experiments conducted over COCO, CrowdPose, and MPII datasets show that SimCC outperforms heatmap-based counterparts, especially in low-resolution settings by a large margin.

연구 동기 및 목표

  • 2D 히트맵 기반 인간 자세 추정(HPE) 방법에서 오랫동안 지속된 양자화 오차 문제를 해결하기 위해.
  • HPE 파이프라인에서 고비용의 업샘플링 레이어와 후처리 보정 단계가 필요 없도록 하기 위해.
  • 특히 저해상도 입력 환경에서의 정밀도 향상을 위해.
  • 지배적인 히트맵 기반 HPE 프레임워크에 대한 더 단순하고 효율적이며 효과적인 대안을 제안하기 위해.

제안 방법

  • 수평(x) 및 수직(y) 좌표에 대한 두 개의 독립적인 1차원 분류 작업으로 2D 인간 자세 추정을 재구성한다.
  • 각 픽셀을 다수의 하위 픽셀 박스로 나누어 하위 픽셀 정밀도를 달성하고, 양자화 오차를 줄인다.
  • 예측을 위해 좌표 헤드(x 및 y)마다 단일 선형 레이어를 사용하여, 복잡한 디컨볼루션 또는 업샘플링 모듈을 회피한다.
  • 일반화 성능 향상을 위해 레이블 스무딩을 적용하였으며, 아블레이션 결과에서 성능 향상에 긍정적인 영향을 미친다.
  • 키포인트 표현을 추출하기 위해 표준 CNN 또는 Transformer 백본을 사용한다.
  • 업샘플링 레이어와 후처리 단계(예: DARK 또는 경험적 이동)를 모두 생략하여 추론 파이프라인을 단순화한다.

실험 결과

연구 질문

  • RQ1좌표 분류를 두 개의 1차원 작업으로 수행할 경우, 2D 히트맵 기반 방법보다 2D 인간 자세 추정에서 성능이 뛰어나게 되는가?
  • RQ2업샘플링 및 후처리 레이어를 제거하면, 특히 저해상도 입력에서 성능이 떨어지거나 향상되는가?
  • RQ32D 히트맵 감독 없이도 균일한 좌표 분할을 통해 효과적으로 하위 픽셀 정밀도를 달성할 수 있는가?
  • RQ4다양한 데이터셋에서 SimCC가 히트맵 기반 모델과 비교해 정확도와 계산 효율성 측면에서 어떻게 성능을 내는가?
  • RQ5제안된 방법이 다양한 백본과 입력 해상도에서 일반화 가능한가?

주요 결과

  • COCO에서 SimCC 기반 HRNet-W32는 256×192 입력에서 73.4 AP를 기록하여, 2D 히트맵 기준선보다 0.7 AP 높다.
  • 64×64 입력 크기에서 SimCC는 COCO에서 46.5 AP를 기록하여, 2D 히트맵 기준선(42.4 AP)보다 4.1점 향상되었다.
  • CrowdPose에서 SimCC는 256×192 입력에서 66.7 AP를 기록하여, 2D 히트맵 기준선(66.4 AP)을 약간 앞서며 추가 계산 비용 없이 성능 향상을 이뤘다.
  • MPII에서 SimCC는 256×256 입력에서 37.8 PCKh@0.1을 기록하여, 2D 히트맵 기준선(33.1 PCKh@0.1)보다 4.7점 향상되었으며, 어려운 샘플에서 뛰어난 성능을 입증했다.
  • SimBa-Res50보다 55% 이상 GFLOPs를 감소시키면서도 더 높은 정확도를 달성하여, 효율성과 효과성 모두 입증되었다.
  • 아블레이션 연구 결과, 레이블 스무딩이 SimCC 성능 향상에 크게 기여함을 확인하였으며, 자가 적응형 스무딩이 미래의 유망한 방향성이 될 것으로 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.