[论文解读] Parallel Reasoning Network for Human-Object Interaction Detection
本文提出并行推理网络(PR-Net),一种基于Transformer的新颖框架,用于人体-物体交互(HOI)检测,通过两个并行的专用预测器,将实例级定位与关系级理解解耦。通过聚焦人体和物体的末端区域进行检测,并将注意力范围扩展至交互接触区域以进行关系推理,PR-Net在HICO-DET和V-COCO基准上实现了最先进性能,同时提升了准确率并降低了计算成本,得益于解耦预测与Trident-NMS后处理机制。
Human-Object Interaction (HOI) detection aims to learn how human interacts with surrounding objects. Previous HOI detection frameworks simultaneously detect human, objects and their corresponding interactions by using a predictor. Using only one shared predictor cannot differentiate the attentive field of instance-level prediction and relation-level prediction. To solve this problem, we propose a new transformer-based method named Parallel Reasoning Network(PR-Net), which constructs two independent predictors for instance-level localization and relation-level understanding. The former predictor concentrates on instance-level localization by perceiving instances' extremity regions. The latter broadens the scope of relation region to reach a better relation-level semantic understanding. Extensive experiments and analysis on HICO-DET benchmark exhibit that our PR-Net effectively alleviated this problem. Our PR-Net has achieved competitive results on HICO-DET and V-COCO benchmarks.
研究动机与目标
- 解决现有HOI检测器中实例级与关系级预测之间注意力焦点不一致的问题。
- 通过解耦定位与语义推理,提升对难负样本和复杂HOI样本的交互理解能力。
- 消除实例预测与关系预测之间后处理匹配或重构步骤的需求。
- 通过并行解耦架构与专用预测器,实现更优的性能与效率。
- 验证一致性损失与Trident-NMS在提升训练与推理效果方面的有效性。
提出的方法
- PR-Net采用两个并行的专用Transformer预测器:一个用于实例级定位,聚焦于人体和物体的末端区域。
- 另一个预测器专注于关系级理解,通过将注意力扩展至交互接触区域和上下文区域。
- 实例级与关系级查询严格对齐,无需在两者之间引入交叉注意力或匹配模块。
- 引入一致性损失,在训练过程中对齐两个预测器之间的特征,增强特征一致性与模型鲁棒性。
- 提出Trident-NMS,通过结合三类框(人、物体、关系)的加权IoU计算TriIoU分数,处理重叠的人、物体与关系框。
- 方法使用共享主干网络(ResNet),并为每个预测器配备独立的解码器头,实现无需重构的高效联合推理。
实验结果
研究问题
- RQ1并行解耦架构能否提升HOI检测中实例级与关系级预测之间的注意力焦点一致性?
- RQ2将实例定位与交互理解分离,是否能提升在难负样本与复杂HOI样本上的性能表现?
- RQ3单一共享主干网络搭配两个独立解码器,是否能在准确率与效率上超越现有的一阶段与两阶段HOI检测器?
- RQ4所提出的统一损失在对齐不同预测层级特征方面是否有效?
- RQ5Trident-NMS在多大程度上通过减少人框重复来提升后处理性能?
主要发现
- 在使用ResNet-50时,PR-Net在HICO-DET上达到31.17%的平均mAP,在使用ResNet-101时达到32.86%,优于相同设置下的QPIC基线(29.07%与29.90%)。
- 仅使用每预测器一个解码器层,PR-Net即达到29.64% mAP,超过QPIC基线(使用六层),证明了其架构效率。
- 消融实验表明,增加解码器层数可提升性能,使用ResNet-101并每预测器三层数时,mAP达到32.86%。
- 基于乘积的Trident-NMS优于基于求和的TriIoU,且提高人框IoU权重可进一步提升性能,表明人框重复现象更严重。
- t-SNE可视化证实,PR-Net为物体与交互类别学习到具有判别性且高度分离的特征,尤其在复杂交互中表现更强。
- 定性结果表明,PR-Net能准确检测细微且难以察觉的HOI样本,例如在复杂场景中正确识别骑手。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。