Skip to main content
QUICK REVIEW

[论文解读] From A Glance to "Gotcha": Interactive Facial Image Retrieval with Progressive Relevance Feedback

Xinru Yang, Haozhi Qi|arXiv (Cornell University)|Jul 30, 2020
Image Retrieval and Classification Techniques参考文献 30被引用 4
一句话总结

本文提出了一种端到端的交互式人脸图像检索框架,采用渐进式相关性反馈,帮助用户仅通过属性级反馈,逐步完善其对嫌疑人的心理图像。通过渐进式披露反馈并利用在CelebA上预训练的SE-ResNet的深度特征,该系统在排名百分位上达到98.66%,优于完全披露设置,且在极低标注成本下展现出强劲性能。

ABSTRACT

Facial image retrieval plays a significant role in forensic investigations where an untrained witness tries to identify a suspect from a massive pool of images. However, due to the difficulties in describing human facial appearances verbally and directly, people naturally tend to depict by referring to well-known existing images and comparing specific areas of faces with them and it is also challenging to provide complete comparison at each time. Therefore, we propose an end-to-end framework to retrieve facial images with relevance feedback progressively provided by the witness, enabling an exploitation of history information during multiple rounds and an interactive and iterative approach to retrieving the mental image. With no need of any extra annotations, our model can be applied at the cost of a little response effort. We experiment on exttt{CelebA} and evaluate the performance by ranking percentile and achieve 99\% under the best setting. Since this topic remains little explored to the best of our knowledge, we hope our work can serve as a stepping stone for further research.

研究动机与目标

  • 为解决目标仅为用户心中心理图像时的人脸图像检索挑战,特别是在法医学背景下的应用。
  • 通过支持即时、基于属性的相关性反馈,减少对昂贵人工标注的依赖,无需事先对图像进行标注。
  • 通过在多轮交互中逐步揭示反馈,模拟人类在人脸比对中的认知行为。
  • 通过在监督式、交互式学习框架中整合图像特征与属性表征,提升检索准确率。

提出的方法

  • 该系统采用基于深度学习的框架,将SE-ResNet提取的图像嵌入与属性向量融合,以表征人脸图像。
  • 采用渐进式披露机制,相关性反馈在多轮中逐步揭示,从遮蔽反馈开始,随时间逐渐提高透明度。
  • 在每轮展示候选图像后,实时收集用户反馈,用户通过属性级对比(例如“戴眼镜”与“不戴”)指出差异。
  • 模型采用对比损失进行端到端训练,以优化目标图像在检索列表中的排名位置。
  • 使用在VGGFace2上预训练并在CelebA上微调的SE-ResNet进行特征提取,以增强属性感知的表征学习能力。

实验结果

研究问题

  • RQ1与完全披露相比,渐进式披露相关性反馈是否能提升人脸图像检索性能?
  • RQ2在交互式设置中,将基于属性的反馈与深度图像特征结合,对检索准确率有何影响?
  • RQ3所提出的框架是否能在无需对数据集进行人工标注的情况下实现高性能?
  • RQ4该模型的性能在多大程度上反映了人类在人脸比对中的认知渐进过程?

主要发现

  • 渐进式披露机制表现最佳,在CelebA数据集上最终达到98.66%的排名百分位。
  • 在渐进式披露设置下,第5轮测试损失为0.0297,显著低于完全披露设置下使用属性时的0.0589。
  • 使用在CelebA上微调的SE-ResNet特征取得了最高性能(98.66%百分位),优于OpenFace(87.02%)和在VGGFace2上训练的SE-ResNet(95.80%)。
  • 尽管在第3轮到第4轮之间匹配属性数从37个下降到34个,但第4轮的候选图像在视觉上是更优匹配,表明特征融合可超越属性数量提升性能。
  • 男性目标的系统收敛更早(通常在第3轮),而女性目标允许更晚的优化,可能由于数据集中女性面部特征更具多样性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。