[论文解读] Interact as You Intend: Intention-Driven Human-Object Interaction Detection
本文提出 iHOI,一种新型的意图驱动的人-物交互(HOI)检测框架,通过利用人类注视和身体姿态提升检测精度。通过建模注意力引导的上下文区域与相对于物体的关节距离,并采用困难负样本三元组挖掘策略,iHOI 在 V-COCO 和 HICO-DET 上实现了最先进性能,当联合建模注视与姿态时,在 V-COCO 上实现了 +4.28 mAP 的提升。
The recent advances in instance-level detection tasks lay strong foundation for genuine comprehension of the visual scenes. However, the ability to fully comprehend a social scene is still in its preliminary stage. In this work, we focus on detecting human-object interactions (HOIs) in social scene images, which is demanding in terms of research and increasingly useful for practical applications. To undertake social tasks interacting with objects, humans direct their attention and move their body based on their intention. Based on this observation, we provide a unique computational perspective to explore human intention in HOI detection. Specifically, the proposed human intention-driven HOI detection (iHOI) framework models human pose with the relative distances from body joints to the object instances. It also utilizes human gaze to guide the attended contextual regions in a weakly-supervised setting. In addition, we propose a hard negative sampling strategy to address the problem of mis-grouping. We perform extensive experiments on two benchmark datasets, namely V-COCO and HICO-DET. The efficacy of each proposed component has also been validated.
研究动机与目标
- 通过利用注视和身体姿态等可观测视觉线索建模人类意图,以提升人-物交互检测性能。
- 通过引入困难负样本三元组挖掘策略,解决 HOI 检测中的错误分组问题。
- 通过利用由人类注视引导的上下文相关区域,提升检测的鲁棒性与准确性。
- 提供一种计算框架,将意图感知的视觉推理整合到实例级 HOI 检测中。
- 验证意图建模在提升预测置信度与抑制假阳性方面的有效性。
提出的方法
- 该框架通过两个关键组件建模人类意图:基于注视的注意力机制以选择信息丰富的上下文区域,以及基于相对关节-物体距离的编码以表示基于姿态的意图。
- 采用弱监督设置利用注视预测,基于注视热图动态选择最相关的前 5 个场景区域。
- 通过人体关节到物体实例的相对距离编码身体姿态,捕捉指示意图的空间关系。
- 提出一种新颖的困难负样本三元组挖掘策略,通过聚焦于模糊或难以分类的三元组,解决错误分组的 HOI 候选。
- 模型在 V-COCO 和 HICO-DET 上端到端训练,联合优化 HOI 三元组分类与意图建模。
- 该框架采用双流结构处理人体与物体特征,通过交叉注意力机制将意图线索与交互预测对齐。

实验结果
研究问题
- RQ1人类注视与身体姿态能否作为 HOI 检测中意图建模的可靠且可计算利用的线索?
- RQ2在复杂社交场景中,整合意图建模在多大程度上能提升 HOI 检测的准确性和鲁棒性?
- RQ3与全局场景特征相比,基于注视的上下文区域选择在多大程度上能提升检测性能?
- RQ4基于错误分组风险的困难负样本三元组挖掘是否能提升泛化能力并减少 HOI 预测中的幻觉?
- RQ5意图建模能否有效抑制由模糊动作或错误物体定位引起的假阳性?
主要发现
- 联合建模注视与姿态在 V-COCO 上相比基线模型 VTransE-HO 实现 +4.28 mAP 提升,在 HICO-DET 上实现 +1.42 mAP 提升。
- 使用前 5 个注视引导的上下文区域可实现最佳性能,兼顾对注视误差的鲁棒性与噪声减少。
- 与基于坐标的姿态编码相比,引入相对关节-物体距离在 V-COCO 上提升 mAP +0.80,在 HICO-DET 上提升 mAP +0.53。
- 所提出的困难负样本三元组挖掘策略相比无挖掘设置,在 V-COCO 上使 mAP 下降减少 3.42 个百分点,显著抑制了交互幻觉。
- 定性结果表明,意图建模能有效抑制假阳性——例如,当姿态与注视与目标物体不一致时,可拒绝“踢”这一动作。
- 当意图线索(注视与姿态)与动作矛盾时,模型能成功拒绝错误三元组如“吃别人的蛋糕”。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。