[论文解读] Differentiable Multi-Granularity Human Representation Learning for Instance-Aware Human Semantic Parsing
该论文提出了一种可微分的、端到端的自下而上的实例感知人体语义解析框架,联合学习类别级语义分割、通过密集到稀疏投影场(DSPF)实现的身体到关节点映射,以及可微分的关键点关联。通过利用残差细化的粗到细DSPF估计和可学习的特征扭曲,并结合可微分的二分图匹配求解器,该方法在拥挤场景中相比自上而下的基线模型实现了显著更快的推理速度,且性能达到当前最先进水平。
To address the challenging task of instance-aware human part parsing, a new bottom-up regime is proposed to learn category-level human semantic segmentation as well as multi-person pose estimation in a joint and end-to-end manner. It is a compact, efficient and powerful framework that exploits structural information over different human granularities and eases the difficulty of person partitioning. Specifically, a dense-to-sparse projection field, which allows explicitly associating dense human semantics with sparse keypoints, is learnt and progressively improved over the network feature pyramid for robustness. Then, the difficult pixel grouping problem is cast as an easier, multi-person joint assembling task. By formulating joint association as maximum-weight bipartite matching, a differentiable solution is developed to exploit projected gradient descent and Dykstra's cyclic projection algorithm. This makes our method end-to-end trainable and allows back-propagating the grouping error to directly supervise multi-granularity human representation learning. This is distinguished from current bottom-up human parsers or pose estimators which require sophisticated post-processing or heuristic greedy algorithms. Experiments on three instance-aware human parsing datasets show that our model outperforms other bottom-up alternatives with much more efficient inference.
研究动机与目标
- 为解决实例感知人体语义解析的挑战,通过自下而上的端到端方式联合学习语义分割与多人姿态估计。
- 通过实现关节分组的可微分监督,克服自下而上姿态估计中启发式后处理和贪心关联的局限性。
- 通过学习一个从密集到稀疏的投影场(DSPF),显式关联语义部件与人体关节点,提升对遮挡和姿态变化的鲁棒性。
- 实现与场景中人数无关的高效、可扩展推理,不同于自上而下方法随人数线性增长的特性。
- 在一个可微分框架内统一学习多粒度人体表征——细粒度语义与稀疏骨骼结构。
提出的方法
- 提出一种密集到稀疏投影场(DSPF),即一个可学习的2D向量场,编码每个人体像素到其最近实例关节点的偏移量,从而实现语义与关节点的显式关联。
- 采用跨特征金字塔的粗到细DSPF估计策略:利用深层低分辨率特征生成粗预测,并通过双线性上采样与残差学习进行残差细化。
- 引入可学习的特征扭曲以对齐跨层特征,减少特征分布偏移,提升DSPF回归的准确性。
- 提出一种基于投影梯度下降与Dykstra循环投影的可微分方法求解关键点关联的二分图匹配问题,支持分组误差的反向传播。
- 采用最大权重二分图匹配作为关节关联的优化目标,并将其重述为可微问题,以支持端到端训练。
- 将所有组件——语义分割、DSPF回归与可微分匹配——整合为一个完全卷积的、可端到端训练的单一神经网络。
实验结果
研究问题
- RQ1可微分的、端到端的框架是否能够无需后处理,联合优化实例感知人体语义解析与多人姿态估计?
- RQ2与直接回归相比,基于残差的粗到细DSPF估计在遮挡和身体形态变化下是否能提升鲁棒性?
- RQ3在姿态估计与解析准确率方面,可微分关节关联在多大程度上优于贪心或启发式匹配策略?
- RQ4自下而上的端到端方法是否能在多人场景中实现比自上而下方法更快的推理速度?
- RQ5跨层特征对齐与残差细化在DSPF预测的稳定性与准确性方面起到了何种贡献?
主要发现
- 所提方法在MHP v2验证集上达到AP${}_{50}^{p}$ = 38.9,优于先前的自下而上方法,在实例感知人体解析任务中达到最先进性能。
- 通过可微分关节关联,模型在mAP姿态指标上达到65.8,显著优于贪心匹配基线(63.9–64.3),证实了端到端监督的优势。
- 消融研究显示,结合粗到细推理、残差细化与可学习扭曲可使AP${}_{50}^{p}$提升3.4个百分点(从35.5提升至38.9),证明了各组件的有效性。
- 模型的推理时间与图像中人数无关,而自上而下模型的推理时间随人数线性增长;在MHP v2上,该方法比M-CE2P和P-RCNN快2–3倍。
- 定性结果表明,该模型在遮挡、拥挤场景和极端姿态等挑战性场景中表现出强大的泛化能力,实现了精确的实例级解析与关节点关联。
- 运行时分析证实,全卷积设计实现了高效、可扩展的推理,使该方法适用于实时与实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。