[论文解读] Resource Aware Person Re-identification across Multiple Resolutions
该论文提出了一种资源感知的行人重识别模型,通过深度监督融合深度卷积网络不同层级的多级特征。通过结合低层次(高分辨率)和高层次(语义)嵌入,该方法在五个基准测试中均实现了最先进(SOTA)的准确率,并在资源受限条件下实现了准确率与计算成本之间的动态权衡。
Not all people are equally easy to identify: color statistics might be enough for some cases while others might require careful reasoning about high- and low-level details. However, prevailing person re-identification(re-ID) methods use one-size-fits-all high-level embeddings from deep convolutional networks for all cases. This might limit their accuracy on difficult examples or makes them needlessly expensive for the easy ones. To remedy this, we present a new person re-ID model that combines effective embeddings built on multiple convolutional network layers, trained with deep-supervision. On traditional re-ID benchmarks, our method improves substantially over the previous state-of-the-art results on all five datasets that we evaluate on. We then propose two new formulations of the person re-ID problem under resource-constraints, and show how our model can be used to effectively trade off accuracy and computation in the presence of resource constraints. Code and pre-trained models are available at https://github.com/mileyan/DARENet.
研究动机与目标
- 解决现有行人重识别模型对所有图像均使用统一的高层次嵌入所导致的局限性,无论个体识别难度如何。
- 通过利用网络早期层的细粒度空间细节,提升对难以识别个体的识别准确率。
- 通过基于置信度或距离度量的早期退出机制,减少对容易识别个体的冗余计算。
- 通过提供一系列计算成本与对应准确率水平,实现在资源受限条件下的高效推理。
- 开发一种统一模型,支持高准确率与低成本推理模式,适用于实际部署。
提出的方法
- 融合ResNet-50主干网络多个阶段的特征嵌入,结合低层次(早期)和高层次(后期)表示。
- 通过在每个中间嵌入头使用三元组损失进行深度监督,以在每一阶段均优化行人重识别任务。
- 基于置信度裕量(到第二近邻的距离)或最短画廊距离,采用早期退出策略以减少计算量。
- 采用多阶段推理流水线,查询可根据预设阈值在任意阶段退出。
- 通过端到端联合优化所有阶段进行训练,确保每一级的一致性与性能。
- 引入预算流式处理设置,以模拟实时、资源受限的推理场景,计算成本通过FLOPs(乘加操作)进行追踪。
实验结果
研究问题
- RQ1能否通过单个深度网络的多级特征融合,在不同身份识别难度水平下提升行人重识别的准确率?
- RQ2如何使单一模型在推理时支持准确率与计算成本之间的动态权衡?
- RQ3哪些有效的早期退出标准可在降低推理成本的同时保持高准确率?
- RQ4所提方法是否能在标准和资源受限的行人重识别设置下均超越最先进模型?
- RQ5低层次与高层次特征在识别中分别发挥何种作用?其融合如何提升模型鲁棒性?
主要发现
- 所提模型在全部五个标准行人重识别基准上均达到最先进性能,在CMC Rank-1准确率上超越了先前方法。
- 在预算流式处理设置中,基于裕量的早期退出策略在更低计算成本下实现了比随机或基于距离的方法更高的准确率。
- 融合的特征表示在整体识别性能上持续优于单一阶段,尤其在低层次与高层次特征产生分歧的困难样本上表现更优。
- 可视化结果表明,早期阶段特征对简单情况(如显眼服装)有效,而后期特征则能应对姿态与视角变化。
- 该模型实现了准确率与计算量之间的平滑权衡,在Market-1501数据集上,计算预算较低时CMC Rank-1准确率约60%,预算较高时超过85%。
- 该方法是首个在行人重识别中支持动态、资源感知推理的方案,提供一系列性能点而非单一固定模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。