[论文解读] Multi-shot Pedestrian Re-identification via Sequential Decision Making
本文提出了一种基于强化学习的多 shot 行人重识别顺序决策框架,其中智能体逐个评估图像对,并选择分类为'相同'或'不同',或请求更多证据('不确定')。通过根据置信度动态调整所用图像数量,该方法仅使用3%至6%的图像即实现了最先进性能,显著提升了效率,同时保持了高精度。
Multi-shot pedestrian re-identification problem is at the core of surveillance video analysis. It matches two tracks of pedestrians from different cameras. In contrary to existing works that aggregate single frames features by time series model such as recurrent neural network, in this paper, we propose an interpretable reinforcement learning based approach to this problem. Particularly, we train an agent to verify a pair of images at each time. The agent could choose to output the result (same or different) or request another pair of images to verify (unsure). By this way, our model implicitly learns the difficulty of image pairs, and postpone the decision when the model does not accumulate enough evidence. Moreover, by adjusting the reward for unsure action, we can easily trade off between speed and accuracy. In three open benchmarks, our method are competitive with the state-of-the-art methods while only using 3% to 6% images. These promising results demonstrate that our method is favorable in both efficiency and performance.
研究动机与目标
- 解决现有多 shot 重识别方法在处理所有帧时效率低下且对噪声敏感的问题。
- 将行人重识别中的决策过程建模为一种顺序的、自适应的过程,以平衡速度与精度。
- 开发一种方法,隐式识别困难或噪声样本,并推迟决策直至收集到足够证据。
- 实现端到端、可解释的决策过程,可通过奖励设计调节以在速度与精度之间进行权衡。
- 证明 Q-value 函数可作为样本难度的可靠指标,从而增强模型可解释性。
提出的方法
- 该方法将多 shot 重识别建模为使用深度强化学习的顺序决策问题。
- 智能体一次处理来自两个轨迹的图像对,并从三种动作中选择:'相同'、'不同' 或 '不确定'(请求更多证据)。
- 智能体的策略使用深度 Q 网络(DQN)进行训练,其奖励函数对错误决策进行惩罚,并奖励早期正确决策。
- 模型结合图像级特征与历史决策上下文以指导当前动作,实现自适应推理。
- 每个动作的 Q-value 输出用于评估当前图像对的置信度与难度,从而实现可解释的决策路径。
- 该框架兼容任何图像级特征提取器,包括非深度学习方法,并支持基于奖励的速度与精度之间的权衡。
实验结果
研究问题
- RQ1强化学习智能体能否通过动态选择检查多少图像对,在多 shot 行人重识别中有效平衡决策速度与精度?
- RQ2与固定聚合方法相比,该模型推迟决策的能力在应对噪声或低质量帧时如何提升鲁棒性?
- RQ3Q-value 函数在多大程度上可作为图像对难度的可靠、可解释的指标?
- RQ4该方法是否能在显著少于基线方法使用图像数量的前提下,实现最先进性能,尤其是在真实监控场景中?
- RQ5在优先考虑速度或精度的不同奖励设置下,模型性能如何变化?
主要发现
- 在 PRID2011 数据集上,所提方法实现了 86.4% 的 CMC Rank 1 准确率,比最佳现有方法高出约 5%。
- 在 iLIDS-VID 和 MARS 数据集上,该方法在性能上与最先进方法相当或更优,CMC Rank 1 结果与使用全部帧的模型相当或更优。
- 该模型平均每对轨迹仅使用 3% 至 6% 的图像,与完整序列基线相比显著降低了计算成本。
- Q-value 函数有效捕捉了图像对的难度,较高值表示更自信的预测,较低值表示模糊或噪声样本。
- 消融实验表明,若移除手工设计特征或用 LSTM 替换历史编码器,性能会显著下降,验证了设计选择的有效性。
- 当图像对随机排序时,模型表现优于按顺序排列的情况,表明非顺序处理有助于避免时间顺序带来的偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。