Skip to main content
QUICK REVIEW

[论文解读] Hybrid-Attention based Decoupled Metric Learning for Zero-Shot Image Retrieval

Binghui Chen, Weihong Deng|arXiv (Cornell University)|Jul 27, 2019
Domain Adaptation and Few-Shot Learning参考文献 39被引用 6
一句话总结

本文提出解耦度量学习(DeML),一种基于混合注意力机制的框架,将统一的度量学习解耦为对象注意力和通道注意力子学习器,以增强零样本图像检索中的特征判别力与泛化能力。通过使用基于随机游走的对象注意力和对抗性通道注意力,DeML在CUB、CARS、Stanford Online Products和In-Shop数据集上显著优于最先进方法,展现出更强的鲁棒性与更低的神经冗余。

ABSTRACT

In zero-shot image retrieval (ZSIR) task, embedding learning becomes more attractive, however, many methods follow the traditional metric learning idea and omit the problems behind zero-shot settings. In this paper, we first emphasize the importance of learning visual discriminative metric and preventing the partial/selective learning behavior of learner in ZSIR, and then propose the Decoupled Metric Learning (DeML) framework to achieve these individually. Instead of coarsely optimizing an unified metric, we decouple it into multiple attention-specific parts so as to recurrently induce the discrimination and explicitly enhance the generalization. And they are mainly achieved by our object-attention module based on random walk graph propagation and the channel-attention module based on the adversary constraint, respectively. We demonstrate the necessity of addressing the vital problems in ZSIR on the popular benchmarks, outperforming the state-of-theart methods by a significant margin. Code is available at http://www.bhchen.cn

研究动机与目标

  • 为解决零样本图像检索(ZSIR)中视觉输入缺乏判别性以及深度模型部分/选择性学习行为带来的问题,这些问题会抑制特征判别力与泛化能力。
  • 将统一的度量学习解耦为特定注意力的子学习器,以显式增强特征判别力并促进多样性。
  • 通过鼓励多个注意力头之间互补知识学习,减轻神经冗余与对已见类别的过拟合。
  • 开发一种与模型无关的框架,不依赖于困难样本挖掘或复杂样本对构建。
  • 验证显式解耦度量学习在提升零样本泛化能力方面的必要性与有效性。

提出的方法

  • DeML将最终的全连接层解耦为多个对象注意力根学习器与通道注意力子学习器,以支持特定注意力的学习。
  • 对象注意力模块(OAMs)通过基于随机游走的图传播实现,可自动识别显著视觉区域,提升特征判别力。
  • 通道注意力模块(CAMs)通过对抗损失($L_{adv}$)进行约束,以促进多样性,防止所有学习器集中于相同简单属性。
  • 框架采用裁剪与缩放的联合操作,生成多尺度特征,以提升定位与表征能力。
  • 该方法与模型无关,可轻松作为即插即用模块集成到现有深度度量学习流程中。
  • 最终表征通过聚合多个特定注意力学习器的预测结果生成,从而增强鲁棒性与泛化能力。

实验结果

研究问题

  • RQ1缺乏判别性的视觉输入在多大程度上影响零样本图像检索中特征的判别能力?
  • RQ2深度模型中部分/选择性学习行为在多大程度上会降低对未见类别的泛化能力?
  • RQ3将统一的度量学习解耦为特定注意力的子学习器,是否能同时提升ZSIR中的判别力与泛化能力?
  • RQ4对通道注意力模块施加对抗性约束,是否能有效减少神经冗余并提升特征多样性?
  • RQ5所提出的DeML框架在多个基准上的检索准确率方面,与最先进方法相比表现如何?

主要发现

  • DeML(I=1, J=8)在CUB上达到59.0% R@1,在CARS上达到82.5% R@1,显著优于基线U512(50.9%和67.1%)及其他SOTA方法。
  • 若不使用对抗损失($L_{adv}$),DeML性能急剧下降至CUB的52.0% R@1和CARS的68.2% R@1,表明多样性强制机制至关重要。
  • 当移除$L_{adv}$后,通道注意力学习器之间的余弦相似度从-0.09上升至0.92,证实该损失有效降低了冗余并促进了互补学习。
  • 即使拥有8个通道注意力学习器,若无$L_{adv}$,性能仍较低,表明独立监督会导致对相似属性的过拟合,无法提升泛化能力。
  • 在Stanford Online Products上,DeML(I=2, J=4)已足够,因为第二尺度已能有效定位判别性区域。
  • 消融实验确认,对象注意力与通道注意力模块均不可或缺,二者结合在所有数据集上均取得最佳性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。