Skip to main content
QUICK REVIEW

[論文レビュー] SimCC: a Simple Coordinate Classification Perspective for Human Pose Estimation

Yanjie Li, Sen Yang|arXiv (Cornell University)|Jul 7, 2021
Human Pose and Action Recognition被引用数 11
ひとこと要約

本稿では、2次元ヒートマップベースの手法における長年の量子化誤差問題を解消するシンプルな座標分類フレームワーク、SimCCを提案する。この手法は、キーポointの局所化をx座標とy座標の2つの独立した1次元分類タスクに再定式化する。各ピクセルを均等にサブピクセルビンに分割することで、最小限の量子化誤差でサブピクセルの局所化精度を達成し、高価なアップサンプリング層や後処理の必要性を排除する。特に低解像度入力においても、ヒートマップベースの手法を上回る性能を発揮するとともに、FLOPsを55%以上削減する。

ABSTRACT

The 2D heatmap-based approaches have dominated Human Pose Estimation (HPE) for years due to high performance. However, the long-standing quantization error problem in the 2D heatmap-based methods leads to several well-known drawbacks: 1) The performance for the low-resolution inputs is limited; 2) To improve the feature map resolution for higher localization precision, multiple costly upsampling layers are required; 3) Extra post-processing is adopted to reduce the quantization error. To address these issues, we aim to explore a brand new scheme, called extit{SimCC}, which reformulates HPE as two classification tasks for horizontal and vertical coordinates. The proposed SimCC uniformly divides each pixel into several bins, thus achieving \emph{sub-pixel} localization precision and low quantization error. Benefiting from that, SimCC can omit additional refinement post-processing and exclude upsampling layers under certain settings, resulting in a more simple and effective pipeline for HPE. Extensive experiments conducted over COCO, CrowdPose, and MPII datasets show that SimCC outperforms heatmap-based counterparts, especially in low-resolution settings by a large margin.

研究の動機と目的

  • 2次元ヒートマップベースの人体ポーズ推定(HPE)手法における長年の量子化誤差問題に対処すること。
  • HPEパイプラインにおける高価なアップサンプリング層や後処理の精緻化の必要性を排除すること。
  • 特に低解像度入力環境下でも局所化精度を向上させること。
  • 支配的であるヒートマップベースのHPEフレームワークに対する、よりシンプルで効率的かつ効果的な代替手法を提案すること。

提案手法

  • 水平(x)および垂直(y)座標の2つの独立した1次元分類タスクに、2次元人体ポーズ推定を再定式化する。
  • 各ピクセルを複数のサブピクセルビンに分割することで、サブピクセルの局所化精度を達成し、量子化誤差を低減する。
  • 予測に座標ヘッド(xおよびy)ごとに1つの線形層を用いることで、複雑なデコンボリューションやアップサンプリングモジュールを回避する。
  • 一般化性能の向上のためラベルスムージングを適用し、アブレーションによりその効果が性能向上に寄与することを確認した。
  • キーポイントの表現を抽出するため、標準的なCNNまたはTransformerバックボーンを用いる。
  • アップサンプリング層および後処理ステップ(例:DARKや経験的シフト)をすべて排除し、推論パイプラインを簡素化する。

実験結果

リサーチクエスチョン

  • RQ12つの1次元タスクとしての座標分類が、2次元ヒートマップベースの手法を上回る性能を発揮できるか?
  • RQ2アップサンプリングおよび後処理層を排除することで、特に低解像度入力において性能が低下するか、あるいは向上するか?
  • RQ32次元ヒートマップの監視なしに、均等なビン分割による座標のサブピクセル局所化を効果的に実現できるか?
  • RQ4多様なデータセットにおいて、SimCCはヒートマップベースのモデルと比較して、精度および計算効率の面で優れているか?
  • RQ5提案手法は、異なるバックボーンおよび入力解像度においても一般化可能か?

主な発見

  • COCOデータセットにおいて、HRNet-W32を用いたSimCCは256×192入力で73.4 APを達成し、2次元ヒートマップベースラインより0.7 AP高い。
  • 64×64入力サイズにおいて、SimCCはCOCOで46.5 APを達成し、2次元ヒートマップベースライン(42.4 AP)より4.1ポイント高い。
  • CrowdPoseでは256×192入力で66.7 APを達成し、2次元ヒートマップベースライン(66.4 AP)をわずかに上回り、追加計算コストなしに実現した。
  • MPIIでは256×256入力で37.8 PCKh@0.1を達成し、2次元ヒートマップベースライン(33.1 PCKh@0.1)より4.7ポイント高い。これは、困難なサンプルにおいて優れた性能を示している。
  • SimBa-Res50と比較して、55%以上のGFLOPsを削減しながらも、より高い精度を達成した。これは、効率性と有効性の両面で優れていることを証明している。
  • アブレーションスタディにより、ラベルスムージングがSimCCの性能を顕著に向上させることを確認した。これは、自己適応的スムージングが有望な今後の方向性であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。