[论文解读] Reformulating HOI Detection as Adaptive Set Prediction
该论文提出AS-Net,一种新颖的一阶段HOI检测框架,通过可学习的交互查询嵌入和基于Transformer的解码器,将交互检测重新定义为自适应集合预测。通过自适应地关注全局上下文特征,并利用可微匹配将预测结果与真实值对齐,AS-Net在不依赖人体姿态或语言特征的前提下,在HICO-DET数据集上实现了31%的相对mAP提升,达到最先进性能。
Determining which image regions to concentrate on is critical for Human-Object Interaction (HOI) detection. Conventional HOI detectors focus on either detected human and object pairs or pre-defined interaction locations, which limits learning of the effective features. In this paper, we reformulate HOI detection as an adaptive set prediction problem, with this novel formulation, we propose an Adaptive Set-based one-stage framework (AS-Net) with parallel instances and interaction branches. To attain this, we map a trainable interaction query set to an interaction prediction set with a transformer. Each query adaptively aggregates the interaction-relevant features from global contexts through multi-head co-attention. Besides, the training process is supervised adaptively by matching each ground truth with the interaction prediction. Furthermore, we design an effective instance-aware attention module to introduce instructive features from the instance branch into the interaction branch. Our method outperforms previous state-of-the-art methods without any extra human pose and language features on three challenging HOI detection datasets. Especially, we achieve over $31\%$ relative improvement on a large-scale HICO-DET dataset. Code is available at https://github.com/yoyomimi/AS-Net.
研究动机与目标
- 解决一阶段HOI检测器中固定交互位置导致的特征适应性受限的问题。
- 通过从全局图像特征中实现动态、上下文感知的注意力机制,提升交互特征学习能力。
- 在保持高性能的同时,消除对外部线索(如人体姿态或语言嵌入)的依赖。
- 设计一个统一的、端到端的一阶段框架,包含并行的实例分支和交互分支,以实现高效且精确的HOI检测。
提出的方法
- 引入可学习的交互查询集合,并通过基于Transformer的交互解码器将其映射为交互预测集合。
- 在交互查询与全局图像特征之间采用多头协同注意力机制,自适应聚合与交互相关的上下文信息。
- 通过预测的交互集合与真实三元组之间的可微匹配实现自适应监督。
- 引入实例感知注意力模块,通过协同注意力将实例级特征注入交互分支。
- 采用双分支架构:一个用于实例检测(位置和类别),另一个用于交互预测(向量和动词类别)。
- 使用从人体中心指向物体中心的交互向量,将预测结果与检测到的实例关联起来。
实验结果
研究问题
- RQ1将HOI检测重新定义为自适应集合预测,能否提升特征的相关性和交互预测的准确性?
- RQ2通过协同注意力从全局上下文中学习交互查询,是否优于一阶段HOI检测器中固定的预测位置?
- RQ3通过将预测结果与真实值匹配实现的自适应监督,能否在无外部监督的情况下提升模型泛化能力?
- RQ4实例感知注意力在将实例级特征整合到交互预测中的有效性如何?
- RQ5能否在一阶段HOI检测器中实现SOTA性能,而无需依赖人体姿态或语言特征?
主要发现
- 与先前最先进方法相比,AS-Net在大规模HICO-DET数据集上实现了31%的相对mAP提升。
- 实例感知注意力模块在基础模型上将mAP提升0.44个百分点,在结合语义嵌入时提升1.12个百分点。
- 同时使用语义嵌入和实例感知注意力的模型,相比仅使用嵌入的基线模型,性能提升1个百分点。
- 消融实验表明,包含6层交互解码器和6个实例感知注意力模块的模型在参数效率与性能之间达到最佳平衡。
- 定性注意力可视化显示,模型聚焦于相关身体部位和物体(如雨伞、手部),同时避免无关特征,证明了特征选择能力的显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。