[论文解读] Learning Compositional Neural Information Fusion for Human Parsing
本文提出了一种用于人体解析的组合式神经信息融合框架,通过整合直接、自顶向下和自底向上三种推理过程,利用人体的分层身体结构。通过可学习门控机制根据源置信度进行融合条件控制,该模型在四个基准数据集上实现了最先进性能,推理速度达23fps。
This work proposes to combine neural networks with the compositional hierarchy of human bodies for efficient and complete human parsing. We formulate the approach as a neural information fusion framework. Our model assembles the information from three inference processes over the hierarchy: direct inference (directly predicting each part of a human body using image information), bottom-up inference (assembling knowledge from constituent parts), and top-down inference (leveraging context from parent nodes). The bottom-up and top-down inferences explicitly model the compositional and decompositional relations in human bodies, respectively. In addition, the fusion of multi-source information is conditioned on the inputs, i.e., by estimating and considering the confidence of the sources. The whole model is end-to-end differentiable, explicitly modeling information flows and structures. Our approach is extensively evaluated on four popular datasets, outperforming the state-of-the-arts in all cases, with a fast processing speed of 23fps. Our code and results have been released to help ease future research in this direction.
研究动机与目标
- 解决现有人体解析方法未能充分利用人体中丰富组合结构的局限性。
- 通过建模多层次语义部件(如头部、四肢、全身)而非仅原子部件,提升解析精度。
- 开发一种端到端可微分框架,融合来自三种推理源(直接、自顶向下、自底向上)的信息。
- 引入置信度感知的融合机制,以抑制不可靠的信息源,提升鲁棒性和精度。
- 通过神经网络中的分层结构建模,实现对人体语义的全面理解。
提出的方法
- 将人体解析建模为在身体部件组合层次上的多源神经信息融合问题。
- 整合三种推理过程:直接(基于图像)、自顶向下(从整体身体到部件)和自底向上(从部件到整体)推理。
- 采用可学习门控机制实现条件融合,根据源置信度动态加权信息。
- 设计一种端到端可微分架构,显式建模层次结构中各层级之间的信息流与结构约束。
- 使用交叉熵损失进行训练,并在第一、第二和第三级节点上对语义部件标签施加多级监督。
- 采用全卷积神经网络作为主干网络,结合跳跃连接与分层跳跃连接,以保留空间与结构细节。
实验结果
研究问题
- RQ1与标准语义分割方法相比,建模人体的组合层次结构是否能提升解析精度?
- RQ2融合来自直接、自顶向下和自底向上推理过程的信息对解析性能有何影响?
- RQ3与固定权重融合相比,置信度条件融合在多大程度上提升了鲁棒性与精度?
- RQ4引入多级监督(涵盖第一、第二和第三级部件)是否能带来更好的特征学习与泛化能力?
- RQ5所提出的框架是否能在多样化的数据集上实现最先进性能,同时保持高推理速度(如23fps)?
主要发现
- 所提模型在四个公开数据集(LIP、PASCAL-Person-Part、ATR、Fashion Clothing)上均达到最先进性能。
- 在PASCAL-Person-Part测试集上,完整模型在第一级达到70.76 mIoU,第二级达到81.62,第三级达到91.31,优于所有消融变体。
- 消融实验表明,加入自底向上与自顶向下推理可带来显著性能提升:仅使用直接推理的基线模型mIoU为64.14,而完整模型在第一级达到70.76。
- 条件融合显著提升性能,通过抑制低置信度源实现,如从直接+自底向上+自顶向下(69.43)到完整模型(70.76)在第一级提升0.59 mIoU。
- 定性结果表明,对细粒度与遮挡部件(如小腿、小手臂)的分割更优,边界更清晰,错误更少,优于SOTA方法如SS-NAN与DeepLabV2。
- 模型推理速度达23fps,展现出适用于实时应用的高效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。