[论文解读] SimCC: a Simple Coordinate Classification Perspective for Human Pose Estimation
本文提出 SimCC,一种用于 2D 人体姿态估计的简单坐标分类框架,将关键点定位重新表述为针对 x 坐标和 y 坐标的两个独立 1D 分类任务。通过将每个像素均匀划分为子像素区间,SimCC 实现了亚像素级别的定位精度,同时最小化量化误差,从而无需昂贵的上采样层和后处理步骤。该方法在低分辨率输入下尤其优于基于热力图的方法,同时将 FLOPs 降低超过 55%。
The 2D heatmap-based approaches have dominated Human Pose Estimation (HPE) for years due to high performance. However, the long-standing quantization error problem in the 2D heatmap-based methods leads to several well-known drawbacks: 1) The performance for the low-resolution inputs is limited; 2) To improve the feature map resolution for higher localization precision, multiple costly upsampling layers are required; 3) Extra post-processing is adopted to reduce the quantization error. To address these issues, we aim to explore a brand new scheme, called extit{SimCC}, which reformulates HPE as two classification tasks for horizontal and vertical coordinates. The proposed SimCC uniformly divides each pixel into several bins, thus achieving \emph{sub-pixel} localization precision and low quantization error. Benefiting from that, SimCC can omit additional refinement post-processing and exclude upsampling layers under certain settings, resulting in a more simple and effective pipeline for HPE. Extensive experiments conducted over COCO, CrowdPose, and MPII datasets show that SimCC outperforms heatmap-based counterparts, especially in low-resolution settings by a large margin.
研究动机与目标
- 解决 2D 热力图基人体姿态估计(HPE)方法中长期存在的量化误差问题。
- 消除人体姿态估计流程中对昂贵上采样层和后处理优化的依赖。
- 提升定位精度,尤其在低分辨率输入设置下。
- 提出一种比主流基于热力图的 HPE 框架更简单、高效且有效的替代方案。
提出的方法
- 将 2D 人体姿态估计重新表述为针对水平(x)和垂直(y)坐标的两个独立 1D 分类任务。
- 将每个像素划分为多个子像素区间,以实现亚像素级别的定位精度并减少量化误差。
- 为每个坐标头(x 和 y)使用单个线性层进行预测,避免使用复杂的转置卷积或上采样模块。
- 应用标签平滑以提升泛化能力,消融实验表明其对性能有积极影响。
- 使用标准的 CNN 或 Transformer 主干网络提取关键点表征,再进行坐标分类。
- 省略上采样层和后处理步骤(如 DARK 或经验偏移),简化推理流程。
实验结果
研究问题
- RQ1将坐标分类作为两个 1D 任务是否能在 2D 人体姿态估计中优于 2D 热力图基方法?
- RQ2在低分辨率输入下,消除上采样和后处理层是否会导致性能下降或提升?
- RQ3是否可以通过对坐标进行均匀分箱,在无 2D 热力图监督的情况下有效实现亚像素定位?
- RQ4在不同数据集上,SimCC 与基于热力图的模型在精度和计算效率方面有何对比?
- RQ5所提出方法是否在不同主干网络和输入分辨率下具有良好的泛化能力?
主要发现
- 在 COCO 数据集上,基于 HRNet-W32 的 SimCC 在 256×192 输入下达到 73.4 AP,比 2D 热力图基线高出 0.7 AP。
- 在 64×64 输入尺寸下,SimCC 在 COCO 上达到 46.5 AP,比 2D 热力图基线高出 4.1 分,表现显著提升。
- 在 CrowdPose 上,SimCC 在 256×192 下达到 66.7 AP,略高于 2D 热力图基线(66.4 AP),且无额外计算开销。
- 在 MPII 上,SimCC 在 256×256 下达到 37.8 PCKh@0.1,比 2D 热力图基线(33.1 PCKh@0.1)高出 4.7 分,展现出在困难样本上的优越性能。
- 与 SimBa-Res50 相比,SimCC 将 GFLOPs 降低超过 55% 同时取得更高精度,证明了其高效性与有效性。
- 消融研究证实,标签平滑显著提升了 SimCC 的性能,提示自适应标签平滑或为未来有前景的研究方向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。