Skip to main content
QUICK REVIEW

[论文解读] Resolving Semantic Confusions for Improved Zero-Shot Detection

Sandipan Sarma, Sushil Kumar|arXiv (Cornell University)|Dec 12, 2022
Domain Adaptation and Few-Shot Learning被引用 6
一句话总结

该论文提出了一种生成式零样本检测方法,通过使用带有三元组损失的条件Wasserstein GAN进行训练,以学习语义相似类别之间的判别性特征,从而减少语义混淆,同时通过循环一致性损失实现视觉-语义一致性。该方法在MSCOCO上达到最先进性能,在PASCAL-VOC上取得具有竞争力的结果,显著提升了未见类别的检测mAP,通过解决特征模糊性实现了性能提升。

ABSTRACT

Zero-shot detection (ZSD) is a challenging task where we aim to recognize and localize objects simultaneously, even when our model has not been trained with visual samples of a few target ("unseen") classes. Recently, methods employing generative models like GANs have shown some of the best results, where unseen-class samples are generated based on their semantics by a GAN trained on seen-class data, enabling vanilla object detectors to recognize unseen objects. However, the problem of semantic confusion still remains, where the model is sometimes unable to distinguish between semantically-similar classes. In this work, we propose to train a generative model incorporating a triplet loss that acknowledges the degree of dissimilarity between classes and reflects them in the generated samples. Moreover, a cyclic-consistency loss is also enforced to ensure that generated visual samples of a class highly correspond to their own semantics. Extensive experiments on two benchmark ZSD datasets - MSCOCO and PASCAL-VOC - demonstrate significant gains over the current ZSD methods, reducing semantic confusion and improving detection for the unseen classes.

研究动机与目标

  • 为解决零样本检测中的语义混淆问题,即模型无法区分语义上相似的类别(如'car'与'train')
  • 通过在特征生成过程中引入类别间差异性,提升未见类别的特征可分性
  • 在合成特征中保持视觉-语义一致性,确保生成的特征与其类别语义相匹配
  • 通过结构化特征合成减少零样本视觉-语义嵌入空间中的hubness问题
  • 在常规和广义零样本检测设置下均实现最先进性能

提出的方法

  • 在已见类别特征上训练一个条件Wasserstein GAN(cWGAN),并引入分类损失,以生成未见类别的特征
  • 引入具有灵活语义边距的三元组损失,以在训练过程中增强语义相似类别之间的特征分离度
  • 应用循环一致性损失,确保生成的视觉特征能够重建其原始类别语义,从而提升对齐程度
  • 采用特征正则化以缓解条件GAN中的模式崩溃问题,提升生成特征的多样性
  • 将生成的特征用于微调Faster R-CNN检测器,实现在未使用其视觉数据的情况下检测未见类别
  • 完整训练目标结合了五种损失:分类损失、三元组损失、循环一致性损失、特征正则化损失和对抗损失

实验结果

研究问题

  • RQ1通过三元组损失训练的生成模型是否能通过提升相似类别间特征的可分性,减少零样本检测中的语义混淆?
  • RQ2在生成的视觉特征与语义嵌入之间强制执行循环一致性,是否能提升未见类别的检测性能?
  • RQ3在MSCOCO和PASCAL-VOC等挑战性基准上,该方法与最先进ZSD方法相比表现如何?
  • RQ4损失组件组合方式及生成特征数量对检测mAP有何影响?
  • RQ5该方法在低可见度或新型物体类别的真实世界场景中是否具备泛化能力?

主要发现

  • 所提方法在MSCOCO上的常规ZSD和广义ZSD设置下均实现了最先进mAP,优于先前方法
  • 在PASCAL-VOC上,该方法取得了第二好的未见类别mAP(19.4%),仅落后于前一SOTA方法0.4%,且特征可分性显著提升
  • 三元组损失对性能贡献最大,单独使用时mAP从18.4%提升至19.4%,证明其在缓解语义混淆中的关键作用
  • 循环一致性损失提升了特征质量和一致性,尤其在与其他损失结合时,对mAP提升有显著贡献
  • 消融实验表明,当五种损失组件全部使用时性能最优,且在MSCOCO上每类生成250个特征时检测准确率最高
  • 定性结果表明,语义相似类别(如car与train)的误分类现象显著减少,证实检测输出中的语义混淆已有效缓解

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。