Skip to main content
QUICK REVIEW

[论文解读] Visual Explanation for Deep Metric Learning

Sijie Zhu, Taojiannan Yang|arXiv (Cornell University)|Sep 27, 2019
Human Pose and Action Recognition参考文献 37被引用 14
一句话总结

本文提出了一种用于深度度量学习中视觉解释的新型激活分解框架,引入了点特定激活图,揭示图像之间像素到像素的对应关系。通过将相似度分数分解为区域级贡献,该方法揭示了细粒度关系(如嘴对嘴或眼对眼匹配),在跨视角模式发现和交互式检索等应用中,其可解释性优于现有的Grad-CAM类方法。

ABSTRACT

This work explores the visual explanation for deep metric learning and its applications. As an important problem for learning representation, metric learning has attracted much attention recently, while the interpretation of such model is not as well studied as classification. To this end, we propose an intuitive idea to show where contributes the most to the overall similarity of two input images by decomposing the final activation. Instead of only providing the overall activation map of each image, we propose to generate point-to-point activation intensity between two images so that the relationship between different regions is uncovered. We show that the proposed framework can be directly deployed to a large range of metric learning applications and provides valuable information for understanding the model. Furthermore, our experiments show its effectiveness on two potential applications, i.e. cross-view pattern discovery and interactive retrieval. The source code is available at \url{https://github.com/Jeff-Zilence/Explain_Metric_Learning}.

研究动机与目标

  • 为解决深度度量学习中缺乏视觉解释的问题,特别是理解哪些图像区域对相似度分数的贡献最大。
  • 揭示两幅图像中对应区域之间的关系,超越全局激活图所能揭示的内容。
  • 开发一种无需架构修改即可适用于多种度量学习任务的白盒解释方法。
  • 验证点特定激活图在真实应用(如跨视角模式发现和交互式检索)中的实用性。

提出的方法

  • 提出激活分解方法,以计算一幅图像中每个空间位置对另一幅图像整体相似度分数的贡献。
  • 通过计算相似度分数对两幅图像最后卷积特征图的梯度,将Grad-CAM扩展至度量学习。
  • 利用链式法则推导基于梯度的激活图,其中梯度从余弦相似度分数反向传播至特征图。
  • 通过计算一幅图像中单个像素对另一幅图像所有位置的激活响应,引入点特定激活图。
  • 使用全局平均池化(GAP)和基于雅可比矩阵的梯度计算,生成与类别无关、与架构无关的视觉解释。
  • 将该方法应用于具有L2归一化嵌入的孪生网络,实现在无需微调或模型修改情况下的解释。

实验结果

研究问题

  • RQ1我们如何可视化在深度度量学习中,两幅图像的哪些区域对学习到的相似度分数贡献最大?
  • RQ2两幅图像中对应区域(如眼睛、嘴巴)之间的关系是什么?这种关系如何进行定量测量?
  • RQ3点特定激活图是否能在度量学习中提升模型可解释性,超越全局激活图?
  • RQ4该方法在真实应用(如跨视角模式发现和交互式检索)中的有效性如何?
  • RQ5所提出的解释框架是否在捕捉细粒度匹配模式方面优于现有方法(如Grad-CAM)?

主要发现

  • 所提出的激活分解方法生成了整体和点特定激活图,揭示了图像之间的详细空间对应关系。
  • 点特定激活图显示,即使激活较弱的区域(如行人重识别图像中的嘴巴),也能对另一幅图像中特定特征(如查询图像中的嘴巴)产生强烈响应,而全局图会忽略此类细节。
  • 实验表明,该方法在生成有意义的激活图方面优于裁剪和掩码基线方法,尤其在使用GAP池化的行人重识别任务中表现更优。
  • 在跨视角模式发现中,该方法成功识别出如不同视角下人脸朝向的一致性模式。
  • 交互式检索结果表明,用户可通过聚焦于点特定图识别出的高响应区域,有效优化搜索。
  • 该方法在多种度量学习任务(包括人脸识别、行人重识别和图像检索)中均表现有效,且无需模型微调。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。