Skip to main content
QUICK REVIEW

[论文解读] Multi-Person Pose Estimation with Enhanced Channel-wise and Spatial Information

Kai Su, Dongdong Yu|arXiv (Cornell University)|May 9, 2019
Human Pose and Action Recognition参考文献 25被引用 8
一句话总结

该论文提出了一种新颖的自顶向下多人员姿态估计方法,通过引入通道混洗模块(CSM)以增强跨尺度通道间的特征交互,并通过空间-通道注意力残差瓶颈(SCARB)自适应地突出显示信息量丰富的空间与通道特征。该方法在使用ResNet-152主干网络的情况下,在COCO test-dev数据集上实现了74.6 AP的最先进性能。

ABSTRACT

Multi-person pose estimation is an important but challenging problem in computer vision. Although current approaches have achieved significant progress by fusing the multi-scale feature maps, they pay little attention to enhancing the channel-wise and spatial information of the feature maps. In this paper, we propose two novel modules to perform the enhancement of the information for the multi-person pose estimation. First, a Channel Shuffle Module (CSM) is proposed to adopt the channel shuffle operation on the feature maps with different levels, promoting cross-channel information communication among the pyramid feature maps. Second, a Spatial, Channel-wise Attention Residual Bottleneck (SCARB) is designed to boost the original residual unit with attention mechanism, adaptively highlighting the information of the feature maps both in the spatial and channel-wise context. The effectiveness of our proposed modules is evaluated on the COCO keypoint benchmark, and experimental results show that our approach achieves the state-of-the-art results.

研究动机与目标

  • 为解决多尺度特征图中跨通道与空间信息利用有限的问题,以提升多人员姿态估计性能。
  • 通过增强特征金字塔中不同分辨率层级之间的通信,改善特征表示。
  • 通过注意力机制自适应地强调融合特征图中最相关的空间与通道特征。
  • 在采用自顶向下框架的前提下,实现在COCO关键点基准上的最先进性能。

提出的方法

  • 通道混洗模块(CSM)在不同分辨率层级的特征图(Conv-2至Conv-5)之间应用通道混洗操作,以促进低层与高层特征之间的跨通道信息流动。
  • CSM在通道维数降低后,将混洗后的特征图(S-Conv-2至S-Conv-5)与原始特征图(Conv-2至Conv-5)进行融合,形成增强的金字塔特征。
  • 空间-通道注意力残差瓶颈(SCARB)将空间与通道注意力机制整合到残差块中,自适应地重新校准空间与通道维度上的特征响应。
  • SCARB被堆叠在特征融合之后,以优化增强的金字塔特征,提升关键点预测的表示质量。
  • 该方法在级联金字塔网络(CPN)框架内进行评估,训练过程中使用L2损失与在线难样本挖掘(Online Hard KeyPoints Mining)。
  • 模型推理采用测试时增强策略,通过翻转与旋转输入以提升鲁棒性与性能。

实验结果

研究问题

  • RQ1在多尺度特征图之间应用通道混洗操作,是否能改善跨通道信息交流并提升姿态估计精度?
  • RQ2在残差块中联合使用空间与通道注意力机制,在多人员姿态估计中能在多大程度上改善特征表示?
  • RQ3在融合特征中同时增强通道与空间信息,是否能在COCO基准上带来一致的性能提升?
  • RQ4在人类检测质量不同的情况下,所提方法与最先进方法的性能表现如何比较?

主要发现

  • 在使用ResNet-152主干网络与测试时增强策略的情况下,该方法在COCO test-dev数据集上实现了74.6 AP,优于先前的最先进方法。
  • 在单模型且无需额外训练数据的情况下,该方法在使用ResNet-152主干网络与384×288输入尺寸时,在COCO test-dev上实现了74.3 AP。
  • 当输入尺寸为256×192时,与基线CPN相比,该模型性能提升了2.7 AP,证明了所提模块的有效性。
  • 即使在人类检测AP(58.1)低于Simple Baselines(60.9)的情况下,该模型仍实现了更高的姿态估计AP(74.3 vs. 73.8),表明姿态估计器性能比检测器性能更为关键。
  • 可视化结果表明,该模型在遮挡与近距离互动等复杂场景下泛化能力更强,而CPN在此类情况下会失效。
  • 消融实验确认,CSM与SCARB均显著贡献性能,其中SCARB在基线基础上加入后带来的性能增益最大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。