Skip to main content
QUICK REVIEW

[论文解读] End-to-End Trainable Multi-Instance Pose Estimation with Transformers

Lucas Stoffl, Maxime Vidal|arXiv (Cornell University)|Mar 22, 2021
Human Pose and Action Recognition参考文献 47被引用 11
一句话总结

该论文提出 POET,一种基于 Transformer 编码器-解码器架构的端到端可训练多实例姿态估计模型,能够通过一次前向传播直接预测多个个体的关键点集合。通过将姿态估计建模为一种基于新设损失函数和二分图匹配的集合预测问题,POET 在 COCO 数据集上实现了最先进精度,同时比以往的自顶向下和自底向上方法更快、参数效率更高,并且通过迁移学习在动物姿态估计任务上也表现出良好的泛化能力。

ABSTRACT

We propose an end-to-end trainable approach for multi-instance pose estimation, called POET (POse Estimation Transformer). Combining a convolutional neural network with a transformer encoder-decoder architecture, we formulate multiinstance pose estimation from images as a direct set prediction problem. Our model is able to directly regress the pose of all individuals, utilizing a bipartite matching scheme. POET is trained using a novel set-based global loss that consists of a keypoint loss, a visibility loss and a class loss. POET reasons about the relations between multiple detected individuals and the full image context to directly predict their poses in parallel. We show that POET achieves high accuracy on the COCO keypoint detection task while having less parameters and higher inference speed than other bottom-up and top-down approaches. Moreover, we show successful transfer learning when applying POET to animal pose estimation. To the best of our knowledge, this model is the first end-to-end trainable multi-instance pose estimation method and we hope it will serve as a simple and promising alternative.

研究动机与目标

  • 开发一种端到端可训练的多实例姿态估计方法,消除对后处理或两阶段网络的需求。
  • 解决现有自顶向下和自底向上方法的局限性,这些方法无法端到端训练且需要复杂的后处理。
  • 通过 Transformer 和二分图匹配,将多实例姿态估计建模为直接的集合预测问题。
  • 在保持 COCO 等挑战性基准高精度的同时,提升推理速度与模型效率。
  • 展示模型在少样本和领域偏移设置(如动物姿态估计)下的可迁移性。

提出的方法

  • POET 将卷积神经网络主干网络与 Transformer 编码器-解码器架构相结合,实现一次前向传播中预测多个个体的姿态。
  • 每个预测姿态表示为一个向量,包含中心坐标、每个关键点的相对偏移量以及可见性分数。
  • 模型使用一种新颖的基于集合的全局损失函数,结合关键点回归损失、可见性损失和类别损失,以监督预测结果。
  • 在训练过程中,通过二分图匹配将预测姿态与真实姿态配对,以分配最接近的预测结果给真实实例。
  • 损失函数是可微的,支持端到端反向传播,使模型能够学习个体与图像上下文之间的联合表征。
  • 该架构受 DETR 启发,但通过引入可学习的中心表示和相对偏移预测,针对关键点预测进行了适配。

实验结果

研究问题

  • RQ1基于 Transformer 的架构能否在无需后处理或两阶段网络的情况下,实现多实例姿态估计的端到端训练?
  • RQ2与标准回归损失相比,所提出的基于集合的损失函数结合二分图匹配,在准确率和泛化能力方面有何提升?
  • RQ3在数据有限的情况下,一个在 COCO 上预训练的模型在不同领域(如动物姿态估计)上的泛化能力如何?
  • RQ4中心损失和 delta 损失组件对关键点定位精度有何影响?
  • RQ5与现有自顶向下和自底向上方法相比,该模型的推理速度如何随图像中人数变化而变化?

主要发现

  • POET 在 COCO 关键点验证集上达到 48.5 mAP 的性能,即使输入分辨率更高,也优于基线模型。
  • 该模型比轻量级的自底向上和自顶向下方法更快,且推理速度不受图像中人数的影响。
  • 通过 COCO 预训练进行迁移学习,使模型在 MacaquePose 数据集上的性能提升至 77.1 mAP,显著优于 ResNet-50 + 关联嵌入基线模型。
  • 消融实验表明,中心损失和 delta 损失组件至关重要,完整损失配置的性能最高。
  • 仅使用相对偏移和中心损失(不包含绝对坐标)训练的模型,在 250 个周期后达到 35.5 mAP,远低于完整模型的 48.5 mAP。
  • 注意力可视化显示,Transformer 模型关注个体之间的相互关系和全局图像上下文,支持其在姿态分组推理方面的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。