[论文解读] HOICLIP: Efficient Knowledge Transfer for HOI Detection with Vision-Language Models
HOICLIP 提出了一种用于 HOI 检测的知识迁移框架,该框架直接从 CLIP 中提取空间、动词和语言先验知识,无需知识蒸馏。通过使用交叉注意力交互解码器、动词表征的视觉语义算术方法,以及无需训练的提示式分类器,该方法在 HICO-Det 上实现了 4.04 mAP 的性能提升,并在少样本和零样本设置下展现出优越的数据效率。
Human-Object Interaction (HOI) detection aims to localize human-object pairs and recognize their interactions. Recently, Contrastive Language-Image Pre-training (CLIP) has shown great potential in providing interaction prior for HOI detectors via knowledge distillation. However, such approaches often rely on large-scale training data and suffer from inferior performance under few/zero-shot scenarios. In this paper, we propose a novel HOI detection framework that efficiently extracts prior knowledge from CLIP and achieves better generalization. In detail, we first introduce a novel interaction decoder to extract informative regions in the visual feature map of CLIP via a cross-attention mechanism, which is then fused with the detection backbone by a knowledge integration block for more accurate human-object pair detection. In addition, prior knowledge in CLIP text encoder is leveraged to generate a classifier by embedding HOI descriptions. To distinguish fine-grained interactions, we build a verb classifier from training data via visual semantic arithmetic and a lightweight verb representation adapter. Furthermore, we propose a training-free enhancement to exploit global HOI predictions from CLIP. Extensive experiments demonstrate that our method outperforms the state of the art by a large margin on various settings, e.g. +4.04 mAP on HICO-Det. The source code is available in https://github.com/Artanic30/HOICLIP.
研究动机与目标
- 解决基于 CLIP 知识蒸馏的现有 HOI 检测方法在数据效率和零样本泛化能力方面的不足。
- 在不依赖大规模标注训练数据的前提下,提升长尾动词类别和罕见交互关系的性能。
- 实现 CLIP 预训练视觉-语言表征的有效、无需训练的利用,用于 HOI 分类。
- 通过知识融合模块将 CLIP 的空间和语言先验与检测主干网络的特征融合,提升检测准确率。
提出的方法
- 基于 Transformer 的交互解码器利用交叉注意力机制,从 CLIP 的视觉特征图中提取定位的交互特征,聚焦于信息丰富的区域。
- 通过视觉语义算术构建动词分类器,从 CLIP 学习到的视觉-语义关系中计算类别权重,避免对大规模动词特定数据的依赖。
- 引入轻量级的动词表征适配器,以优化动词表征并提升细粒度交互的判别能力。
- 通过无需训练的增强方法,利用 CLIP 的文本编码器生成基于提示的语言表征,在推理阶段进行集成。
- 知识融合模块将 CLIP 的空间和语言特征与检测主干网络的特征融合,以提升人-物对定位和交互分类的性能。
- 该框架通过直接检索并利用跨视觉、语言和空间模态的预训练 CLIP 先验知识,避免了知识蒸馏。

实验结果
研究问题
- RQ1与知识蒸馏相比,直接检索 CLIP 的预训练知识是否能提升 HOI 检测中的数据效率?
- RQ2在长尾和低数据场景下,视觉语义算术如何增强动词表征学习?
- RQ3无需训练的提示式文本分类器是否能提升 HOI 检测中的零样本泛化能力?
- RQ4在完整、罕见和非罕见类别上,集成 CLIP 的空间和语言先验在多大程度上提升了检测准确率和鲁棒性?
主要发现
- 在完全监督设置下,HOICLIP 在 HICO-Det 数据集上相比之前最先进方法实现了 +4.04 mAP 的性能提升。
- 该模型展现出卓越的数据效率,在训练数据减少至 5% 时,仍优于 GEN-VLKT 等基线方法。
- 使用视觉语义算术的动词分类器在完整类别设置下,相比句子描述方法提升了 1.16 mAP,相比平均 HOI 表征方法提升了 1.45 mAP。
- 通过 top-k 全局预测的无需训练增强方法,在平均 mAP 上提升了 0.15 个百分点,且推理开销极低。
- HOICLIP 在单张 A100 GPU 上保持了具有竞争力的推理速度(55.52 ms/img),尽管性能更高,但仅比 GEN-VLKT 略有增加。
- 消融实验证实,每个组件——空间特征提取、动词适配器和语言增强——均对整体性能有逐步的贡献。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。