[论文解读] Deep Hybrid Similarity Learning for Person Re-identification
本文提出深度混合相似度学习(DHSL),一种基于卷积神经网络(CNN)的人重识别方法,通过从深层特征的逐元素绝对差值和乘积中学习混合相似度函数,提升相似度度量性能。该方法采用仅含三个卷积层的轻量化网络,实现SOTA性能,且推理速度显著快于以往方法。
Person Re-IDentification (Re-ID) aims to match person images captured from two non-overlapping cameras. In this paper, a deep hybrid similarity learning (DHSL) method for person Re-ID based on a convolution neural network (CNN) is proposed. In our approach, a CNN learning feature pair for the input image pair is simultaneously extracted. Then, both the element-wise absolute difference and multiplication of the CNN learning feature pair are calculated. Finally, a hybrid similarity function is designed to measure the similarity between the feature pair, which is realized by learning a group of weight coefficients to project the element-wise absolute difference and multiplication into a similarity score. Consequently, the proposed DHSL method is able to reasonably assign parameters of feature learning and metric learning in a CNN so that the performance of person Re-ID is improved. Experiments on three challenging person Re-ID databases, QMUL GRID, VIPeR and CUHK03, illustrate that the proposed DHSL method is superior to multiple state-of-the-art person Re-ID methods.
研究动机与目标
- 解决基于CNN的人重识别方法中特征学习与度量学习之间的不平衡问题。
- 通过设计结合深层特征绝对差值与乘积的可学习混合相似度函数,提升相似度度量性能。
- 通过优化特征学习与度量学习模块中的参数效率,降低对大规模训练数据的依赖。
- 在保持高精度的同时实现低推理成本,支持实时部署。
提出的方法
- 使用仅含三个卷积层的轻量化CNN进行特征提取,以最小化计算成本。
- 对于每对图像,网络提取特征对,并计算特征的逐元素绝对差值与逐元素乘积。
- 通过应用一组可学习的权重系数,将拼接后的差值与乘积特征投影到最终的相似度分数,从而学习混合相似度函数。
- 在训练过程中端到端优化混合相似度函数,以提升对简单欧氏距离或余弦距离的判别能力。
- 联合优化特征学习与度量学习,避免对维度压缩或后处理的依赖。
- 使用标准反向传播训练模型,采用三元组损失或对比损失以增强类间分离性。
实验结果
研究问题
- RQ1结合绝对差值与乘积的可学习混合相似度函数是否能提升标准距离度量在人重识别中的准确率?
- RQ2仅含三个卷积层的轻量化CNN是否能在降低计算成本的同时实现具有竞争力的性能?
- RQ3所提方法的性能如何随训练数据集规模的变化而变化?
- RQ4在特征提取与相似度计算方面,DHSL的推理速度与SOTA重识别方法相比如何?
主要发现
- 在QMUL GRID数据集上,DHSL仅用200名训练个体即达到44.87%的Rank-1准确率,优于MLAPG、XQDA和MRank-RankSVM等方法。
- 在VIPeR数据集上,DHSL使用316名训练个体达到44.87%的Rank-1准确率,超越KISSME、DML和IDLA,并与MTL-LORAE及Deep RDC相当或更优。
- 在QMUL GRID上仅用75名训练个体,DHSL的性能即优于XQDA与MRank-RankSVM,表明其对数据量依赖极低。
- DHSL的特征提取时间(FET)在CPU上仅为每张图像4.9781 ms,低于LOMO的10.1297 ms,且仅为JSTL+DGD的111.0322 ms的4.48%。
- DHSL的相似度计算时间(SCT)在CPU上仅为每对0.0373 ms,显著快于JSTL+DGD的5.9347 ms。
- DHSL的FET + SCT总时间不足LOMO的一半,且仅为JSTL+DGD的FET的9.28%,充分证明其高效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。