[论文解读] Pose-aware Multi-level Feature Network for Human Object Interaction Detection
本文提出PMFNet,一种姿态感知的多层级特征网络,用于人体-物体交互(HOI)检测。该方法利用人体姿态信息,在交互、视觉物体和人体部位三个语义层级上引导注意力,实现细粒度、鲁棒且可解释的HOI预测。该模型在V-COCO和HICO-DET基准上达到最先进性能,在V-COCO上的mAP达到53.0,显著优于先前方法。
Reasoning human object interactions is a core problem in human-centric scene understanding and detecting such relations poses a unique challenge to vision systems due to large variations in human-object configurations, multiple co-occurring relation instances and subtle visual difference between relation categories. To address those challenges, we propose a multi-level relation detection strategy that utilizes human pose cues to capture global spatial configurations of relations and as an attention mechanism to dynamically zoom into relevant regions at human part level. Specifically, we develop a multi-branch deep network to learn a pose-augmented relation representation at three semantic levels, incorporating interaction context, object features and detailed semantic part cues. As a result, our approach is capable of generating robust predictions on fine-grained human object interactions with interpretable outputs. Extensive experimental evaluations on public benchmarks show that our model outperforms prior methods by a considerable margin, demonstrating its efficacy in handling complex scenes.
研究动机与目标
- 为解决在视觉差异细微且空间结构复杂的场景中检测细粒度人体-物体交互的挑战。
- 通过引入人体姿态作为空间与注意力引导线索,提升HOI检测的鲁棒性与可解释性。
- 克服仅使用粗粒度物体级表征时无法捕捉相似关系(如'hold'与'catch')中判别性局部线索的局限。
- 通过统一的深度神经网络,实现交互、物体与人体部位三个语义层级的端到端交互推理学习。
- 生成注意力图以突出显示相关人体部位,为每类交互提供可解释的预测结果。
提出的方法
- 模型采用多分支深度网络,包含四个模块:主干网络、整体特征模块、局部聚焦模块和融合模块,用于处理三个语义层级的特征。
- 姿态增强的空间配置图(SCM)通过关键点提供的空间布局信息,丰富物体与人体掩码特征,提升候选区域筛选效果。
- 局部聚焦模块通过部位裁剪与空间对齐,提取并归一化相对于物体的人体部位特征,增强局部上下文表征。
- 语义注意力机制基于姿态布局计算部位级注意力分数,聚焦于与每类关系相关的判别性身体部位。
- 引入交互亲和度(IA)以抑制误报,通过评分人类与物体候选区域之间发生交互的可能性。
- 融合模块将整体特征与部位级特征结合,生成最终的HOI类别得分,支持端到端训练。
实验结果
研究问题
- RQ1人体姿态信息能否提升对视觉差异细微的细粒度人体-物体交互的检测性能?
- RQ2多层级特征表征(交互、物体、人体部位)在HOI检测中如何提升鲁棒性与准确性?
- RQ3姿态引导的注意力机制能否生成可解释且有意义的视觉解释,用于HOI预测?
- RQ4各组件的消融实验(如部位裁剪、空间对齐、语义注意力)对整体性能的贡献程度如何?
- RQ5所提出的多层级推理策略在多样化且复杂的视觉场景中是否具备良好的泛化能力?
主要发现
- PMFNet在V-COCO验证集上达到53.0的mAP,显著优于此前最先进方法。
- 空间配置图(SCM)相比基线模型提升0.7 mAP,证明其在空间推理中的有效性。
- 仅使用部位裁剪(PC)组件可使mAP从49.2提升至49.9;结合其他组件后,mAP进一步达到52.4。
- 语义注意力(SeAtten)机制生成可解释的注意力图,能清晰突出相关人体部位,如'hold'关系中的手部,'sit'关系中的全身。
- 单一分量移除消融实验表明,SCM、PC、SpAlign、SeAtten、IA各组件均对最终性能有显著贡献。
- 定性结果表明,该模型能以更高置信度检测到较小或难以察觉的物体,并生成与人类直觉一致的注意力图。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。