[论文解读] Incorporating Intra-Class Variance to Fine-Grained Visual Recognition
本文提出组敏感三元组采样(GS-TRS),通过在三元组损失中引入组感知采样来建模类内差异,从而提升细粒度视觉识别性能。通过将每个类别中的图像聚类为多个组,并将组内相似性引入三元组损失,GS-TRS改善了特征表示,在CompCar和VehicleID数据集上实现了最先进性能,重识别任务中mAP最高提升30%,检索任务中top-500精度提升超过5%。
Fine-grained visual recognition aims to capture discriminative characteristics amongst visually similar categories. The state-of-the-art research work has significantly improved the fine-grained recognition performance by deep metric learning using triplet network. However, the impact of intra-category variance on the performance of recognition and robust feature representation has not been well studied. In this paper, we propose to leverage intra-class variance in metric learning of triplet network to improve the performance of fine-grained recognition. Through partitioning training images within each category into a few groups, we form the triplet samples across different categories as well as different groups, which is called Group Sensitive TRiplet Sampling (GS-TRS). Accordingly, the triplet loss function is strengthened by incorporating intra-class variance with GS-TRS, which may contribute to the optimization objective of triplet network. Extensive experiments over benchmark datasets CompCar and VehicleID show that the proposed GS-TRS has significantly outperformed state-of-the-art approaches in both classification and retrieval tasks.
研究动机与目标
- 为解决细粒度视觉识别中类内差异过高的挑战,该挑战会降低特征表示质量和识别性能。
- 通过显式建模类内结构,超越传统类间对比学习,提升三元组网络的学习效果。
- 通过联合优化Softmax损失和三元组损失,同时提升细粒度识别任务中的分类与检索性能。
- 设计一种分组策略,利用基于聚类的中级表示捕捉类内不变性与差异性。
- 证明基于类内组计算的均值锚点可进一步提升三元组嵌入质量。
提出的方法
- 组敏感三元组采样(GS-TRS)通过聚类将每个类别内的训练图像划分为多个组,以建模类内差异。
- 三元组不仅跨不同类别构建,也跨同一类别内的不同组构建,从而实现类内结构的学习。
- GS-TRS损失函数在标准三元组损失基础上扩展,强制同一组内样本的嵌入距离更近,从而建模类内不变性。
- 该方法联合优化Softmax分类损失与GS-TRS三元组损失,以提升特征的判别能力。
- 使用均值锚点作为同一类别内多个组的正样本参考,以稳定并提升嵌入学习效果。
- 该方法在CompCar和VehicleID两个基准数据集上对图像检索与分类任务进行了评估。
实验结果
研究问题
- RQ1通过分组采样建模类内差异,是否能提升细粒度视觉识别中三元组网络的性能?
- RQ2通过GS-TRS引入类内结构,对检索与分类任务中的特征表示质量有何影响?
- RQ3使用来自多个类内组的均值锚点,是否能进一步增强三元组嵌入的鲁棒性与准确性?
- RQ4在细粒度检索任务中,GS-TRS与最先进方法相比,在mAP和top-K精度方面表现如何?
- RQ5建模类内差异在多大程度上减轻了视角、姿态与光照变化带来的负面影响?
主要发现
- GS-TRS结合均值锚点在VehicleID小测试集上达到74.6%的mAP,相比之前最先进方法Mixed Diff+CCL在大测试集上提升了30%。
- 在CompCars检索任务中,GS-TRS结合均值锚点在top-500上达到39.3%的mAP,相比基线三元组损失提升5.6%。
- 在分类任务中,GS-TRS结合均值锚点将准确率提升至79.85%,相比基线Softmax损失提升1.6%,证明其在分类任务中的优势。
- 在VehicleID大测试集上,GS-TRS的Top-1匹配率提升至73.2%,相比Mixed Diff+CCL提升30%。
- 图5中的CMC曲线显示,从Top 1到Top 50的性能均实现一致且显著的提升,验证了方法在不同检索排名下的鲁棒性。
- 消融实验表明,使用均值锚点可额外提升2%的mAP,证明其在稳定类内表示方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。