[论文解读] Relational Context Learning for Human-Object Interaction Detection
本文提出MUREN,一种基于三分支Transformer的人工交互(HOI)检测方法,通过多路关系上下文学习增强关系推理能力。通过建模人、物体和交互标记之间的单重、成对和三重关系,并利用注意力融合模块选择性传播上下文信息,MUREN在HICO-DET和V-COCO基准上实现了最先进性能。
Recent state-of-the-art methods for HOI detection typically build on transformer architectures with two decoder branches, one for human-object pair detection and the other for interaction classification. Such disentangled transformers, however, may suffer from insufficient context exchange between the branches and lead to a lack of context information for relational reasoning, which is critical in discovering HOI instances. In this work, we propose the multiplex relation network (MUREN) that performs rich context exchange between three decoder branches using unary, pairwise, and ternary relations of human, object, and interaction tokens. The proposed method learns comprehensive relational contexts for discovering HOI instances, achieving state-of-the-art performance on two standard benchmarks for HOI detection, HICO-DET and V-COCO.
研究动机与目标
- 解决现有两分支Transformer-based HOI检测方法中解码器分支间上下文交换有限的问题。
- 克服解耦架构中因交互感知上下文不足而导致的关系推理能力欠缺问题。
- 通过建模人、物体和交互标记之间丰富且多层次的关系上下文(单重、成对、三重),提升HOI检测性能。
- 设计三分支架构,以学习更具判别性的特征,分别用于人检测、物体检测和交互分类。
- 通过注意力融合机制实现分支间有效且任务特定的上下文交换。
提出的方法
- 提出多路关系嵌入模块(MURE),从人、物体和交互标记中计算单重、成对和三重关系上下文。
- 将单重上下文建模为每类标记内部的自注意力机制(例如,仅交互上下文);成对上下文建模为两类标记之间的交叉注意力(例如,人-交互);三重上下文则建模为三类标记的联合表示。
- 引入注意力融合模块,通过任务特定的标记条件和通道注意力机制,选择性地传播相关上下文信息。
- 通过逐元素相加的方式,将任务特定的标记与选定的关系上下文融合到每个分支中,实现目标导向的上下文交换。
- 采用三分支Transformer解码器架构:一个用于人检测,一个用于物体检测,一个用于交互分类。
- 采用标准HOI检测损失端到端训练,通过多任务学习优化检测头与分类头。

实验结果
研究问题
- RQ1建模多层次关系上下文(单重、成对、三重)是否能提升HOI检测性能?
- RQ2通过注意力融合模块实现的选择性上下文传播是否能增强HOI检测中的关系推理能力?
- RQ3与两分支或单分支设计相比,三分支架构在特征判别性和性能方面表现如何?
- RQ4与参数共享相比,解耦人和物体分支在多大程度上能提升检测准确率?
- RQ5分支间丰富的上下文交换是否能缓解解耦Transformer在关系推理方面的局限性?
主要发现
- MUREN在HICO-DET上达到68.8的AP,在V-COCO上达到71.0的AP,优于先前方法,实现最先进性能。
- 消融实验表明,移除注意力融合模块后,HICO-DET性能下降2.25个百分点,V-COCO下降2.04个百分点,证明其有效性。
- 融合模块中‘条件控制’与‘通道注意力’的结合取得最佳性能,证实不同子任务需要不同的上下文信息。
- 在人和物体分支间共享参数会显著降低性能——与非共享版本MUREN-(0)相比,MUREN-(6)在HICO-DET上下降2.2个百分点,在V-COCO上下降1.9个百分点。
- 可视化结果表明,交互分支关注于交互发生的区域,且MURE模块突出显示了整体关系区域,验证了其在关系推理中的作用。
- 完全解耦的模型(MUREN-(0))在准确率上高于参数量匹配但共享层的变体(MUREN†),证明专用人和物体编码器的优势。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。