[论文解读] Query-guided End-to-End Person Search
该论文提出 QEEPS,这是首个端到端、查询引导的行人检索网络,通过利用查询图像中的全局和局部线索,联合优化行人检测与重识别。它引入了查询引导的孪生挤压-激励网络(QSSE-Net)、查询引导的区域建议网络(QRPN)以及查询相似性子网络(QSimNet),在 CUHK-SYSU 数据集上实现了 88.9% 的 mAP 和 89.1% 的 top-1 准确率,达到当前最先进水平,分别比之前的方法高出 5.9 个百分点和 5.4 个百分点。
Person search has recently gained attention as the novel task of finding a person, provided as a cropped sample, from a gallery of non-cropped images, whereby several other people are also visible. We believe that i. person detection and re-identification should be pursued in a joint optimization framework and that ii. the person search should leverage the query image extensively (e.g. emphasizing unique query patterns). However, so far, no prior art realizes this. We introduce a novel query-guided end-to-end person search network (QEEPS) to address both aspects. We leverage a most recent joint detector and re-identification work, OIM [37]. We extend this with i. a query-guided Siamese squeeze-and-excitation network (QSSE-Net) that uses global context from both the query and gallery images, ii. a query-guided region proposal network (QRPN) to produce query-relevant proposals, and iii. a query-guided similarity subnetwork (QSimNet), to learn a query-guided reidentification score. QEEPS is the first end-to-end query-guided detection and re-id network. On both the most recent CUHK-SYSU [37] and PRW [46] datasets, we outperform the previous state-of-the-art by a large margin.
研究动机与目标
- 为解决行人检索中检测与重识别流程化处理的局限性,通过统一为联合优化框架来实现两者的一体化。
- 通过利用查询图像中的全局和局部特定模式(如衣物纹理和颜色),提升建议框生成与特征匹配性能。
- 设计一个完全端到端可训练的网络,使检测与重识别均基于完整的查询图像进行条件化处理,而非独立处理。
- 通过在特征通道与空间区域中集成查询感知注意力机制,超越现有最先进方法在 CUHK-SYSU 和 PRW 等基准数据集上的表现。
提出的方法
- 提出 QSSE-Net,一种查询引导的孪生挤压-激励模块,通过利用查询图像与图库图像特征之间的全局相互依赖关系,重新校准通道维度上的特征响应。
- 引入 QRPN,一种查询引导的区域建议网络,通过改进的挤压-激励机制增强空间与通道维度上的特征,以生成与查询相关的建议框。
- 设计 QSimNet,一种查询相似性子网络,通过比较查询图像与图库图像建议框的特征,学习查询条件化的重识别得分。
- 扩展 OIM 损失函数,以支持整个网络的端到端训练,联合优化检测与重识别任务。
- 采用基于 Faster R-CNN 的两阶段检测器,共享主干网络,其中重识别分支基于 QSSE-Net 和 QRPN 提供的查询感知特征进行条件化处理。
- 端到端处理查询图像与图库图像,使模型在推理过程中能够利用查询图像的全局上下文与局部判别性线索。
实验结果
研究问题
- RQ1与顺序处理的流水线相比,检测与重识别的联合端到端训练是否能提升行人检索性能?
- RQ2如何有效利用查询图像中的全局与局部特征,以指导行人检索中的建议框生成与特征匹配?
- RQ3在特征通道与空间区域中引入查询感知注意力机制,是否能带来更鲁棒、更准确的行人检索性能?
- RQ4一个查询引导的端到端网络是否能在具有挑战性的行人检索基准上超越现有最先进方法?
主要发现
- QEEPS 在 CUHK-SYSU 数据集上实现了 88.9% 的 mAP 和 89.1% 的 top-1 准确率,创下新的最先进水平,分别比之前的最先进方法 Mask-G 提高了 5.9 个百分点和 5.4 个百分点。
- 在 PRW 数据集上,QEEPS 实现了 37.1% 的 mAP 和 76.7% 的 top-1 准确率,创下新最先进水平,分别比 Mask-G 提高了 4.5 个百分点和 4.6 个百分点。
- 仅 QSimNet 模块本身就在 CUHK-SYSU 上将 mAP 和 top-1 准确率分别提升了 7.1 个百分点和 4.3 个百分点,证明了查询引导相似性学习的有效性。
- 在按 TFLOPs 归一化后,QEEPS 的推理速度是 Mask-G 的 3.14 倍,显存占用仅为 Mask-G 的 4.27 倍,尽管其处理了查询与图库图像的端到端推理。
- 定性结果表明,QEEPS 在低分辨率、遮挡或光照不良等具有挑战性的查询情况下仍能成功检索到正确匹配,而基线方法则失败。
- 失败案例主要源于定位错误、标注不准确或人员之间视觉高度相似,表明模型在真实世界复杂条件下仍具备较强的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。