Skip to main content
QUICK REVIEW

[论文解读] Is Object Detection Necessary for Human-Object Interaction Recognition?

Ying Jin, Yinpeng Chen|arXiv (Cornell University)|Jul 27, 2021
Multimodal Machine Learning Applications参考文献 36被引用 4
一句话总结

该论文提出DEFR,一种无需检测的视觉-语言预训练方法,通过利用基于CLIP的文本嵌入初始化和一种新颖的Log-Sum-Exp Sign(LSE-Sign)损失函数,实现了SOTA性能。该方法不依赖物体或人体关键点检测,在HICO数据集上达到60.5 mAP的性能,比检测监督方法高出13.4 mAP,表明图像-文本预训练与结构化多标签学习可有效消除检测监督并提升准确率。

ABSTRACT

This paper revisits human-object interaction (HOI) recognition at image level without using supervisions of object location and human pose. We name it detection-free HOI recognition, in contrast to the existing detection-supervised approaches which rely on object and keypoint detections to achieve state of the art. With our method, not only the detection supervision is evitable, but superior performance can be achieved by properly using image-text pre-training (such as CLIP) and the proposed Log-Sum-Exp Sign (LSE-Sign) loss function. Specifically, using text embeddings of class labels to initialize the linear classifier is essential for leveraging the CLIP pre-trained image encoder. In addition, LSE-Sign loss facilitates learning from multiple labels on an imbalanced dataset by normalizing gradients over all classes in a softmax format. Surprisingly, our detection-free solution achieves 60.5 mAP on the HICO dataset, outperforming the detection-supervised state of the art by 13.4 mAP

研究动机与目标

  • 探究物体检测是否对高性能人类-物体交互识别是必要的。
  • 通过消除物体与人体关键点的检测监督,简化HOI识别流程。
  • 通过有效利用图像-文本预训练与新型多标签损失函数,提升无检测HOI识别性能。
  • 证明无检测方法可超越检测监督的SOTA方法。

提出的方法

  • 使用在ImageNet或CLIP上预训练的视觉Transformer主干网络,其线性分类头通过HOI类别标签的文本嵌入进行初始化。
  • 利用CLIP的文本编码器生成类别标签嵌入以初始化分类器,即使在仅使用图像预训练的主干网络上,也能显著提升性能。
  • 提出Log-Sum-Exp Sign(LSE-Sign)损失函数,以类似Softmax的方式对所有类别进行梯度归一化,从而在类别不平衡的数据集上更好地学习多标签信息。
  • 在微调过程中应用LSE-Sign损失,以促使模型关注损失最高的(最困难的)类别,从而提升所有HOI类别上的泛化能力。
  • 在LSE-Sign损失中引入标量超参数γ以控制梯度幅度,最优性能出现在γ=100时。
  • 采用两阶段训练流程:第一阶段,使用预编码的文本嵌入初始化分类器;第二阶段,使用LSE-Sign损失微调整个模型。

实验结果

研究问题

  • RQ1是否可以在不依赖物体或人体关键点检测监督的情况下,有效实现人类-物体交互识别?
  • RQ2当用于分类器初始化时,图像-文本预训练(如CLIP)如何提升无检测HOI识别的性能?
  • RQ3新型损失函数是否能在类别不平衡的多标签HOI识别中超越标准二元交叉熵损失?
  • RQ4文本嵌入初始化与结构化多标签损失的结合是否能带来优于检测监督方法的性能?

主要发现

  • DEFR仅使用图像-文本预训练与LSE-Sign损失,在HICO数据集上达到60.5 mAP,比检测监督的SOTA方法(47.1 mAP)高出13.4 mAP。
  • 使用CLIP文本编码器进行分类器初始化,相比随机初始化,在CLIP预训练的ViT-B/32主干网络上性能提升23.7 mAP。
  • LSE-Sign损失优于二元交叉熵、加权BCE与焦点损失,在最佳模型上达到60.5 mAP,而BCE仅达57.9 mAP。
  • LSE-Sign损失中最优标量γ为100,此时mAP达60.5;在更高或更低的γ值下性能显著下降。
  • 即使使用ImageNet预训练的图像主干网络,使用BERT或CLIP文本编码器进行嵌入初始化,性能仍提升10+ mAP。
  • 该方法在所有测试的预训练主干网络(包括CLIP、ImageNet-1K与ImageNet-21K)上均达到SOTA性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。