[论文解读] Neural-Logic Human-Object Interaction Detection
LogicHOI 提出了一种基于 Transformer 的新型 HOI 检测器,通过用三元组推理注意力取代固定的人员-物体对输入,实现了对未观察到的 {人员, 动作, 物体} 三元组的动态推理。通过在一阶逻辑中建立可及性(affordances)和邻近空间关系(proxemics)并将其投影到连续空间,该模型提升了零样本泛化能力,并在 V-COCO 和 HICO-DET 上实现了最先进性能。
The interaction decoder utilized in prevalent Transformer-based HOI detectors typically accepts pre-composed human-object pairs as inputs. Though achieving remarkable performance, such paradigm lacks feasibility and cannot explore novel combinations over entities during decoding. We present L OGIC HOI, a new HOI detector that leverages neural-logic reasoning and Transformer to infer feasible interactions between entities. Specifically, we modify the self-attention mechanism in vanilla Transformer, enabling it to reason over the triplet and constitute novel interactions. Meanwhile, such reasoning process is guided by two crucial properties for understanding HOI: affordances (the potential actions an object can facilitate) and proxemics (the spatial relations between humans and objects). We formulate these two properties in first-order logic and ground them into continuous space to constrain the learning process of our approach, leading to improved performance and zero-shot generalization capabilities. We evaluate L OGIC HOI on V-COCO and HICO-DET under both normal and zero-shot setups, achieving significant improvements over existing methods.
研究动机与目标
- 解决现有 HOI 检测器依赖预组合的人员-物体对所带来的局限,这些局限限制了其对新组合的泛化能力。
- 克服当前方法缺乏推理能力的问题,这些方法将交互视为对固定对的静态预测,而非动态推理。
- 将符号知识(特别是可及性与邻近空间关系)整合到深度学习中,以指导更具逻辑性和泛化能力的交互预测。
- 通过一阶逻辑约束预测至物理和语义上合理的交互,实现零样本泛化。
- 开发一种更高效、更有效的 HOI 检测框架,在保持高性能的同时,相比先前方法降低计算开销。
提出的方法
- 修改 Transformer 解码器中的自注意力机制,使其作用于由人员、动作和物体组成的三元组查询,实现对三者联合推理。
- 引入三元组推理注意力,通过同时聚合所有三个组件的信息来更新表示,而非仅关注预定义的配对。
- 将可及性(物体可支持的动作)和邻近空间关系(交互的空间合理性)形式化为一阶逻辑约束。
- 使用可微函数将这些逻辑约束嵌入连续空间,以指导 Transformer 模型的学习过程。
- 通过两个辅助损失进行优化:$\mathcal{L}_{v,p}$ 用于视觉-物理合理性(邻近空间关系),$\mathcal{L}_{o,p}$ 用于物体-动作兼容性(可及性)。
- 应用查询过滤并最小化解码器层数与查询数量,以保持效率,尽管推理能力增强,仍实现比先前方法更快的推理速度。

实验结果
研究问题
- RQ1基于 Transformer 的 HOI 检测器是否能在不依赖训练数据中出现的 {人员, 动作, 物体} 三元组情况下,泛化到未见三元组?
- RQ2如何有效将符号知识(如可及性与邻近空间关系)整合到神经网络中,以提升推理能力与零样本泛化?
- RQ3将注意力机制修改为对三元组而非配对进行推理,是否能带来更好的性能与更可解释的预测?
- RQ4逻辑引导的约束是否能减少模型对虚假相关性的依赖,并提升对罕见或未见交互的鲁棒性?
- RQ5在神经架构中引入符号推理时,模型复杂度、推理速度与性能之间的权衡如何?
主要发现
- LogicHOI 在 HICO-DET 的完整数据集上实现了 25.97 mAP 的新 SOTA 性能,较之前 SOTA 提升 1.96 个百分点。
- 在 HICO-DET 的稀有类别划分上,LogicHOI 达到 15.67 mAP,较之前 SOTA 提升 2.41 个百分点,展现出强大的零样本泛化能力。
- 消融实验证实,$\mathcal{L}_{v,p}$(邻近空间关系)与 $\mathcal{L}_{o,p}$(可及性)均对性能有显著贡献,尤其在零样本设置下更为明显。
- 该模型保持了高效率:仅使用 3 层解码器和 32 个查询,就在 ResNet-50 主干网络上实现了 16.84 FPS 的推理速度,优于大多数单阶段检测器的推理速度与 FLOPs。
- 当查询数量超过 32 后性能开始下降,表明表示能力与优化稳定性之间存在最优平衡点。
- 逻辑引导学习的整合带来了更快的收敛速度与更合理的预测结果,体现在模型在推理过程中能有效排除物理上不合理的交互。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。