[论文解读] DARI: Distance metric And Representation Integration for Person Verification
本文提出 DARI,一种端到端深度学习框架,联合优化特征表示与马氏距离度量,用于行人重识别。通过将马氏矩阵作为因子分解的全连接层集成到卷积神经网络中,DARI 实现了基于反向传播的联合优化,在 CUHK03、CUHK01 和 iLIDS 数据集上均取得了最先进性能,rank-1 准确率分别为 55.4%、65.95% 和 42.8%。
The past decade has witnessed the rapid development of feature representation learning and distance metric learning, whereas the two steps are often discussed separately. To explore their interaction, this work proposes an end-to-end learning framework called DARI, i.e. Distance metric And Representation Integration, and validates the effectiveness of DARI in the challenging task of person verification. Given the training images annotated with the labels, we first produce a large number of triplet units, and each one contains three images, i.e. one person and the matched/mismatch references. For each triplet unit, the distance disparity between the matched pair and the mismatched pair tends to be maximized. We solve this objective by building a deep architecture of convolutional neural networks. In particular, the Mahalanobis distance matrix is naturally factorized as one top fully-connected layer that is seamlessly integrated with other bottom layers representing the image feature. The image feature and the distance metric can be thus simultaneously optimized via the one-shot backward propagation. On several public datasets, DARI shows very promising performance on re-identifying individuals cross cameras against various challenges, and outperforms other state-of-the-art approaches.
研究动机与目标
- 解决行人重识别中将特征表示学习与距离度量学习视为独立阶段的局限性。
- 探索深度特征学习与度量学习之间的协同作用,以提升对姿态、光照和视角变化的鲁棒性。
- 开发一种端到端可训练的框架,联合优化表示学习与距离度量,以提升泛化能力。
- 通过将马氏矩阵因子分解为卷积神经网络架构中的可学习全连接层,克服优化马氏矩阵的计算挑战。
- 在无需微调的情况下验证模型在不同数据集间的泛化能力,证明其对领域偏移的鲁棒性。
提出的方法
- 将训练图像组织为三元组单元,每个单元包含一个参考图像、一个正样本(同一人)和一个负样本(不同人)。
- 将目标定义为在嵌入空间中最大化正样本对与负样本对之间的距离差异。
- 将马氏距离矩阵作为因子分解的全连接层集成到卷积神经网络顶部,通过反向传播实现联合优化。
- 使用小批量三元组采样进行随机梯度下降,以实现大规模数据集的可扩展训练。
- 尽管三元组数量呈立方增长,仍通过在图像上而非三元组上计算梯度来降低计算成本。
- 通过随机裁剪进行数据增强,以减轻过拟合并提升泛化性能。
实验结果
研究问题
- RQ1与分别学习相比,联合优化深度特征表示与马氏距离度量是否能提升行人重识别性能?
- RQ2将可学习的马氏矩阵集成到卷积神经网络架构中,对模型性能与训练效率有何影响?
- RQ3所提出的端到端框架在无需微调的情况下,其泛化能力在多大程度上适用于不同数据集?
- RQ4数据增强与三元组采样策略对模型收敛性与准确率有何影响?
- RQ5与固定某一组件(如固定特征或固定度量)的方法相比,表示与度量的联合优化有何优势?
主要发现
- 在 CUHK03 数据集上,DARI 实现了 55.4% 的 rank-1 识别率,创下新最先进水平。
- 在 CUHK01 数据集上,DARI 达到 65.95% 的 rank-1 准确率,显著优于次佳方法 8.25 个百分点。
- 在 iLIDS 上进行跨数据集评估时,DARI 在未微调条件下于 CUHK03 上训练、在 iLIDS 上测试,仍取得 42.8% 的 rank-1 准确率,展现出强大的泛化能力。
- 消融实验表明,若移除联合优化(Ours-nj),在 CUHK03 上性能降至 45.4%,在 CUHK01 上降至 57.7%,证实了联合学习的重要性。
- 若无数据增强,top-1 准确率下降约 30%,凸显了该增强策略在减轻过拟合方面的有效性。
- 通过从 60 人生成 4800 个三元组的三元组生成策略,相比仅生成 60 个三元组的策略,收敛更快且性能更优,证实了密集三元组采样带来的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。