[论文解读] Pose-based Modular Network for Human-Object Interaction Detection
该论文提出了一种基于姿态的模块化网络(PMN),通过结合相对空间姿态特征(关节到物体的偏移)和绝对姿态特征(归一化的关键点坐标),提升了人体-物体交互(HOI)检测的性能。该模块采用独立分支分别建模空间与内在姿态特征,利用图卷积网络进行特征优化,并在与VS-GATs结合时实现了最先进性能,在V-COCO上mAP提升2.0,在HICO-DET各类别上提升0.98–1.57。
Human-object interaction(HOI) detection is a critical task in scene understanding. The goal is to infer the triplet in a scene. In this work, we note that the human pose itself as well as the relative spatial information of the human pose with respect to the target object can provide informative cues for HOI detection. We contribute a Pose-based Modular Network (PMN) which explores the absolute pose features and relative spatial pose features to improve HOI detection and is fully compatible with existing networks. Our module consists of a branch that first processes the relative spatial pose features of each joint independently. Another branch updates the absolute pose features via fully connected graph structures. The processed pose features are then fed into an action classifier. To evaluate our proposed method, we combine the module with the state-of-the-art model named VS-GATs and obtain significant improvement on two public benchmarks: V-COCO and HICO-DET, which shows its efficacy and flexibility. Code is available at \url{https://github.com/birlrobotics/PMN}.
研究动机与目标
- 通过引入超越基础视觉与空间特征的细粒度人体姿态线索,提升人体-物体交互(HOI)检测性能。
- 解决在多人与多物体紧密相邻的拥挤场景中,因误检导致的假阳性问题。
- 设计一种模块化、兼容性强的组件,可在不改变现有HOI检测模型架构的前提下,增强其性能。
- 探究人体关节与物体之间的空间关系与内在姿态配置在HOI推理中的相对贡献。
提出的方法
- 该方法构建两类姿态特征:相对空间姿态特征,定义为每个人体关键点与目标物体边界框中心之间的偏移量。
- 同时定义绝对姿态特征为相对于人体自身边界框的归一化关键点坐标,以捕捉内在姿态配置。
- 专用分支独立处理每个关节的相对空间姿态特征,采用全连接层进行建模。
- 另一分支则对绝对姿态特征应用图卷积网络(GCNs),通过建模关节关系的全连接图结构进行特征更新。
- 将两个分支处理后的特征进行融合,并输入动作分类器以预测三元组。
- PMN模块具备即插即用特性,可与现有HOI模型(如VS-GATs)兼容,支持端到端训练。
实验结果
研究问题
- RQ1人体关键点与物体之间的相对空间姿态特征是否能提升复杂场景下的HOI检测准确率?
- RQ2代表内在人体姿态的绝对姿态特征在区分交互动作方面贡献有多大?
- RQ3姿态线索的整合在多人交互的拥挤场景中,如何有效减少假阳性?
- RQ4所提出的模块化设计是否能在无需从头训练的前提下,有效提升最先进HOI检测模型的性能?
主要发现
- PMN模块在V-COCO基准上将最先进模型VS-GATs的mAP提升2.0(4.0%),达到51.8 mAP。
- 在更具挑战性的HICO-DET数据集中,该方法使VS-GATs在Full集上提升0.98 mAP(4.6%),在Rare集上提升1.57 mAP(9.8%),在Non-Rare集上提升0.75 mAP(3.5%)。
- 消融实验表明,相对空间特征与绝对姿态特征均对性能有正向贡献,其中相对特征影响更强。
- PMN在拥挤场景中显著减少了假阳性,与VS-GATs的定性对比结果清晰显示了这一点。
- 仅使用简单MLP的无复杂结构姿态网络(NFPN)基线模型虽能提升VS-GATs性能,但表现仍逊于PMN,证明了基于图的特征学习的优势。
- 所提出的模块与现有HOI模型完全兼容,支持即插即用,实现稳定且一致的性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。