[论文解读] Dont Even Look Once: Synthesizing Features for Zero-Shot Detection
该论文提出DELO,一种新颖的零样本检测框架,通过使用条件变分自编码器(CVAE)合成未见物体类别的视觉特征,以提升包含未见物体的边界框的置信度预测。通过在训练中引入合成的未见特征,并采用重采样策略平衡前景与背景样本,DELO在Pascal VOC和MSCOCO数据集上实现了最先进性能,显著提升了未见类别检测的准确率,且无需在测试阶段使用标注数据。
Zero-shot detection, namely, localizing both seen and unseen objects, increasingly gains importance for large-scale applications, with large number of object classes, since, collecting sufficient annotated data with ground truth bounding boxes is simply not scalable. While vanilla deep neural networks deliver high performance for objects available during training, unseen object detection degrades significantly. At a fundamental level, while vanilla detectors are capable of proposing bounding boxes, which include unseen objects, they are often incapable of assigning high-confidence to unseen objects, due to the inherent precision/recall tradeoffs that requires rejecting background objects. We propose a novel detection algorithm Dont Even Look Once (DELO), that synthesizes visual features for unseen objects and augments existing training algorithms to incorporate unseen object detection. Our proposed scheme is evaluated on Pascal VOC and MSCOCO, and we demonstrate significant improvements in test accuracy over vanilla and other state-of-art zero-shot detectors
研究动机与目标
- 解决零样本目标检测中基线检测器对包含未见物体的边界框无法赋予高置信度的局限性。
- 克服因物体存在分数过低而导致未见物体被过滤的精确率-召回率权衡问题。
- 实现在测试阶段无需在训练中使用未见类别的标注样本,同时检测已见和未见物体。
- 开发一种训练流程,通过引入未见类别的合成视觉特征,以提升泛化能力和置信度预测。
提出的方法
- 训练一个条件变分自编码器(CVAE),利用其语义嵌入生成未见物体类别的合成视觉特征。
- CVAE通过组合损失函数进行优化,包括重建损失、置信度预测损失和分类损失,以提升特征质量与一致性。
- 引入视觉一致性检查模块,结合置信度预测器和属性分类器,监督特征生成并确保语义对齐。
- 在训练中采用受焦点损失启发的重采样策略,以平衡前景与背景样本,提升未见物体的召回率。
- 生成已见和未见类别的合成特征,并用于增强训练数据,使检测器能够学习鲁棒的置信度分数。
- 置信度预测器与真实已见特征、合成已见特征及合成未见特征联合训练,以实现对已见与未见类别的泛化能力。
实验结果
研究问题
- RQ1未见物体类别的合成视觉特征能否提升零样本检测中的置信度预测?
- RQ2将合成特征引入训练流程对未见类别检测性能有何影响?
- RQ3视觉一致性检查模块中不同组件(置信度预测器、属性分类器)对特征质量与检测准确率的影响如何?
- RQ4生成的未见样本数量如何影响检测性能与模型收敛?
- RQ5训练过程中重采样在多大程度上缓解了前景-背景类别不平衡问题,并提升未见物体的召回率?
主要发现
- DELO在TU(测试未见)和TM(测试混合)基准上均达到最先进性能,在Pascal VOC的10/10划分中,仅使用合成未见特征时TU mAP达到59.5。
- 视觉一致性检查模块(包含置信度与属性预测器)显著提升性能,相比无监督基线CVAE,TU mAP提升0.6分。
- 当不使用任何合成未见样本时,TU与TM性能均下降超过2%,证明特征合成对零样本检测至关重要。
- 当生成1,000个合成未见样本后,性能趋于饱和,表明少量高质量生成特征已足以实现有效泛化。
- 重采样策略有效缓解了前景-背景类别不平衡问题,在不降低已见类别精确率的前提下,提升了未见物体的召回率。
- 即使不微调零样本识别模型,DELO仍能保持高质量边界框,大量预测能正确定位未见物体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。