[论文解读] TokenPose: Learning Keypoint Tokens for Human Pose Estimation
TokenPose 提出了一种基于 Transformer 的新型框架,将人体关键点表示为可学习的标记(tokens),以显式建模视觉外观与解剖学约束关系。通过同时关注视觉标记和关键点标记,该方法在 COCO 数据集上实现了最先进(SOTA)的精度,参数量比先前基于 CNN 的模型减少 80.6%,浮点运算量(FLOPs)减少 75.3%。
Human pose estimation deeply relies on visual clues and anatomical constraints between parts to locate keypoints. Most existing CNN-based methods do well in visual representation, however, lacking in the ability to explicitly learn the constraint relationships between keypoints. In this paper, we propose a novel approach based on Token representation for human Pose estimation~(TokenPose). In detail, each keypoint is explicitly embedded as a token to simultaneously learn constraint relationships and appearance cues from images. Extensive experiments show that the small and large TokenPose models are on par with state-of-the-art CNN-based counterparts while being more lightweight. Specifically, our TokenPose-S and TokenPose-L achieve $72.5$ AP and $75.8$ AP on COCO validation dataset respectively, with significant reduction in parameters ($\downarrow80.6\%$; $\downarrow$ $56.8\%$) and GFLOPs ($\downarrow$ $75.3\%$; $\downarrow$ $24.7\%$). Code is publicly available.
研究动机与目标
- 为解决基于 CNN 的姿态估计算法在显式建模关键点之间解剖学约束关系方面的局限性。
- 在单一可微分框架中统一视觉外观与结构约束的学习。
- 探索纯 Transformer 架构在无需预训练的情况下用于 2D 人体姿态估计的可行性。
- 在保持或提升性能的同时,降低模型复杂度与计算成本。
提出的方法
- 每个关键点被表示为一个可学习的、与类别相关的标记,通过自注意力与交叉注意力机制,分别关注视觉标记和其他关键点标记。
- 视觉标记通过将输入图像划分为图像块(patches),并将其投影到固定维度的嵌入空间中生成。
- 模型采用混合或纯 Transformer 编码器架构,处理视觉标记与关键点标记之间的交互。
- 关键点标记初始化为随机参数,并在训练过程中联合优化,以编码关节之间的统计关系。
- 最终的关键点位置通过基于关键点标记最终表示,关注视觉标记来预测。
- 可视化最后一层自注意力的注意力权重,以分析模型如何学习约束关系(如邻接性、对称性)。
实验结果
研究问题
- RQ1可学习的关键点标记能否在自监督方式下有效建模关节之间的解剖学约束关系?
- RQ2关键点标记与视觉标记之间的交互如何提升姿态估计的精度?
- RQ3无需预训练的纯 Transformer 架构能否在 2D 人体姿态估计中实现具有竞争力的性能?
- RQ4该模型在保持 SOTA 精度的前提下,能在多大程度上减少参数量与 FLOPs?
主要发现
- TokenPose-S 在 COCO 验证集上达到 72.5 AP,相比最先进 CNN 模型,参数量减少 80.6%,FLOPs 减少 75.3%。
- TokenPose-L 在 COCO 上达到 75.8 AP,优于许多更大的基于 CNN 的模型,同时参数量减少 56.8%,FLOPs 减少 24.7%。
- 模型学习到了有意义的先验知识:关键点标记与邻近或对称关节之间显示出高度相似性,该结果通过注意力分数与内积矩阵得到验证。
- 可视化结果表明,关键点标记逐步关注相关身体部位(如踝关节关注膝盖),并利用对称关节作为线索,用于遮挡关键点的预测。
- 纯 Transformer 架构的 TokenPose-T 在无需预训练的情况下实现了具有竞争力的性能,证明了基于标记设计的有效性。
- 注意力机制显示,约束学习被隐式编码在关键点标记中,前两名注意力头通常对应邻近与对称关节。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。