Skip to main content
QUICK REVIEW

[论文解读] Incorporating Intra-Class Variance to Fine-Grained Visual Recognition

Yan Bai, Feng Gao|arXiv (Cornell University)|Mar 1, 2017
Advanced Image and Video Retrieval Techniques参考文献 12被引用 7
一句话总结

本文提出组敏感三元组采样(GS-TRS),通过在三元组损失中引入组感知采样来建模类内差异,从而提升细粒度视觉识别性能。通过将每个类别中的图像聚类为多个组,并将组内相似性引入三元组损失,GS-TRS改善了特征表示,在CompCar和VehicleID数据集上实现了最先进性能,重识别任务中mAP最高提升30%,检索任务中top-500精度提升超过5%。

ABSTRACT

Fine-grained visual recognition aims to capture discriminative characteristics amongst visually similar categories. The state-of-the-art research work has significantly improved the fine-grained recognition performance by deep metric learning using triplet network. However, the impact of intra-category variance on the performance of recognition and robust feature representation has not been well studied. In this paper, we propose to leverage intra-class variance in metric learning of triplet network to improve the performance of fine-grained recognition. Through partitioning training images within each category into a few groups, we form the triplet samples across different categories as well as different groups, which is called Group Sensitive TRiplet Sampling (GS-TRS). Accordingly, the triplet loss function is strengthened by incorporating intra-class variance with GS-TRS, which may contribute to the optimization objective of triplet network. Extensive experiments over benchmark datasets CompCar and VehicleID show that the proposed GS-TRS has significantly outperformed state-of-the-art approaches in both classification and retrieval tasks.

研究动机与目标

  • 为解决细粒度视觉识别中类内差异过高的挑战,该挑战会降低特征表示质量和识别性能。
  • 通过显式建模类内结构,超越传统类间对比学习,提升三元组网络的学习效果。
  • 通过联合优化Softmax损失和三元组损失,同时提升细粒度识别任务中的分类与检索性能。
  • 设计一种分组策略,利用基于聚类的中级表示捕捉类内不变性与差异性。
  • 证明基于类内组计算的均值锚点可进一步提升三元组嵌入质量。

提出的方法

  • 组敏感三元组采样(GS-TRS)通过聚类将每个类别内的训练图像划分为多个组,以建模类内差异。
  • 三元组不仅跨不同类别构建,也跨同一类别内的不同组构建,从而实现类内结构的学习。
  • GS-TRS损失函数在标准三元组损失基础上扩展,强制同一组内样本的嵌入距离更近,从而建模类内不变性。
  • 该方法联合优化Softmax分类损失与GS-TRS三元组损失,以提升特征的判别能力。
  • 使用均值锚点作为同一类别内多个组的正样本参考,以稳定并提升嵌入学习效果。
  • 该方法在CompCar和VehicleID两个基准数据集上对图像检索与分类任务进行了评估。

实验结果

研究问题

  • RQ1通过分组采样建模类内差异,是否能提升细粒度视觉识别中三元组网络的性能?
  • RQ2通过GS-TRS引入类内结构,对检索与分类任务中的特征表示质量有何影响?
  • RQ3使用来自多个类内组的均值锚点,是否能进一步增强三元组嵌入的鲁棒性与准确性?
  • RQ4在细粒度检索任务中,GS-TRS与最先进方法相比,在mAP和top-K精度方面表现如何?
  • RQ5建模类内差异在多大程度上减轻了视角、姿态与光照变化带来的负面影响?

主要发现

  • GS-TRS结合均值锚点在VehicleID小测试集上达到74.6%的mAP,相比之前最先进方法Mixed Diff+CCL在大测试集上提升了30%。
  • 在CompCars检索任务中,GS-TRS结合均值锚点在top-500上达到39.3%的mAP,相比基线三元组损失提升5.6%。
  • 在分类任务中,GS-TRS结合均值锚点将准确率提升至79.85%,相比基线Softmax损失提升1.6%,证明其在分类任务中的优势。
  • 在VehicleID大测试集上,GS-TRS的Top-1匹配率提升至73.2%,相比Mixed Diff+CCL提升30%。
  • 图5中的CMC曲线显示,从Top 1到Top 50的性能均实现一致且显著的提升,验证了方法在不同检索排名下的鲁棒性。
  • 消融实验表明,使用均值锚点可额外提升2%的mAP,证明其在稳定类内表示方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。