Skip to main content
QUICK REVIEW

[论文解读] A Solution to Product detection in Densely Packed Scenes

Tianze Rong, Yanjia Zhu|arXiv (Cornell University)|Jul 23, 2020
Video Surveillance and Tracking Methods参考文献 11被引用 5
一句话总结

该论文提出了一种针对密集排列场景中产品检测的定制化解决方案,采用改进的随机裁剪策略和优化的Cascade R-CNN,在SKU-110k数据集上实现了58.7%的mmAP。该方法通过增强的数据增强、采样器重加权、NMS超参数调优以及架构改进(如ResNeXt和BFP颈部结构),有效应对了小目标检测与高实例密度的挑战。

ABSTRACT

This work is a solution to densely packed scenes dataset SKU-110k. Our work is modified from Cascade R-CNN. To solve the problem, we proposed a random crop strategy to ensure both the sampling rate and input scale is relatively sufficient as a contrast to the regular random crop. And we adopted some of trick and optimized the hyper-parameters. To grasp the essential feature of the densely packed scenes, we analysis the stages of a detector and investigate the bottleneck which limits the performance. As a result, our method obtains 58.7 mAP on test set of SKU-110k.

研究动机与目标

  • 为解决在真实零售场景(如SKU-110k数据集所示)中检测大量密集小目标的挑战。
  • 克服标准目标检测流水线在MS COCO等低密度数据集上优化后,在高密度场景下表现受限的问题。
  • 通过调整数据采样、模型采样和推理超参数,提升每张图像中最多759个目标的检测性能。
  • 在COCO风格的[0.5:0.95:0.05]评估协议下,实现更高平均精度(mAP),以应对密集排列的产品检测场景。

提出的方法

  • 采用改进的“随机七宫格裁剪”策略,从七个固定区域(四个角、中心点以及短边的两个端点)采样,以提升真实标注框的覆盖度,并减少边界框被截断的情况。
  • 通过将RPN和R-CNN采样器的最大正样本数量分别提升至512和3072,优化采样策略,以更好地应对每张图像中高密度的目标。
  • 采用正交设计的网格搜索对NMS超参数进行调优,最终选择最优参数:3000个输入/输出候选框、0.05置信度阈值、0.7 IoU阈值用于正样本,以及400个最大输出框。
  • 采用三阶段Cascade R-CNN,各阶段逐步提高IoU阈值(0.5、0.5–0.6、0.5–0.6–0.7),以提升定位精度并减少误报。
  • 将主干网络由ResNet-50替换为ResNeXt-101,将FPN颈部结构替换为BFP,以增强特征表示能力与多尺度特征融合效果。
  • 使用大尺寸输入(最高达3000×1800)并训练24个周期,以提升小目标检测性能,同时保持高分辨率输入以保留物体细节。

实验结果

研究问题

  • RQ1如何改进数据增强策略,以确保在零售场景中密集排列目标的充分且具代表性的采样?
  • RQ2在每张图像中目标数量超过150个(如COCO标准设置之外)的场景下,RPN和R-CNN采样器的超参数应如何调整以应对高目标密度?
  • RQ3在重叠度高、误报率高的密集检测场景中,NMS超参数调优能在多大程度上提升mAP?
  • RQ4在密集场景中,使用具有多IoU阈值头的Cascade R-CNN如何提升定位精度并减少误报?
  • RQ5ResNeXt和BFP颈部等架构组件在高密度产品检测任务中的性能影响如何?

主要发现

  • 基线Faster R-CNN使用ResNet-50和FPN结构在SKU-110k数据集上仅达到50.6%的mmAP,表明在该数据集上需要针对性优化。
  • 仅通过优化NMS超参数,mAP即提升至52.8%,表明推理配置对性能有显著影响。
  • 将RPN和R-CNN采样器的正样本最大数量提升后,mAP进一步增至54.0%,表明标准COCO设置下的默认参数不足以应对密集场景。
  • 采用“随机七宫格裁剪”策略,结合大输入尺寸(3000×1800)和24个周期训练,mAP达到57.4%,优于标准随机裁剪和较短训练周期。
  • 完整流水线(包含Cascade R-CNN、ResNeXt-101、BFP颈部结构及优化超参数)在验证集上达到58.0%的mmAP,在测试集上达到58.7%的mmAP,为本研究中的最高结果。
  • 最终模型在测试集上实现了58.7%的mmAP,证明了该组合方法在密集产品检测任务中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。