Skip to main content
QUICK REVIEW

[论文解读] Pedestrian Detection: Domain Generalization, CNNs, Transformers and Beyond

Irtiza Hasan, Shengcai Liao|arXiv (Cornell University)|Jan 10, 2022
Advanced Neural Network Applications被引用 16
一句话总结

本文将最先进行人检测器在跨数据集泛化能力差的问题识别为关键局限,归因于数据集特定的架构偏差以及单调的自动驾驶基准。提出一种使用多样化、网络爬取数据集(CrowdHuman、WiderPedestrian)进行预训练的渐进式微调流程,表明尽管在单一数据集基准上表现相似,基于CNN的检测器在泛化能力上优于Transformer模型,且集成模型在CityPersons和EuroCityPersons上达到SOTA水平。

ABSTRACT

Pedestrian detection is the cornerstone of many vision based applications, starting from object tracking to video surveillance and more recently, autonomous driving. With the rapid development of deep learning in object detection, pedestrian detection has achieved very good performance in traditional single-dataset training and evaluation setting. However, in this study on generalizable pedestrian detectors, we show that, current pedestrian detectors poorly handle even small domain shifts in cross-dataset evaluation. We attribute the limited generalization to two main factors, the method and the current sources of data. Regarding the method, we illustrate that biasness present in the design choices (e.g anchor settings) of current pedestrian detectors are the main contributing factor to the limited generalization. Most modern pedestrian detectors are tailored towards target dataset, where they do achieve high performance in traditional single training and testing pipeline, but suffer a degrade in performance when evaluated through cross-dataset evaluation. Consequently, a general object detector performs better in cross-dataset evaluation compared with state of the art pedestrian detectors, due to its generic design. As for the data, we show that the autonomous driving benchmarks are monotonous in nature, that is, they are not diverse in scenarios and dense in pedestrians. Therefore, benchmarks curated by crawling the web (which contain diverse and dense scenarios), are an efficient source of pre-training for providing a more robust representation. Accordingly, we propose a progressive fine-tuning strategy which improves generalization. Code and models can accessed at https://github.com/hasanirtiza/Pedestron.

研究动机与目标

  • 研究最先进行人检测器在不同数据集之间泛化能力差的问题,尤其是在小领域偏移情况下的表现。
  • 识别当前检测器中架构偏差是泛化能力受限的根本原因,尤其在针对目标领域定制的基于锚点的设计中。
  • 评估主干网络(CNN与Transformer)在跨数据集评估下的泛化性能表现。
  • 证明来自网络爬取来源的大规模、多样化数据集(如CrowdHuman、WiderPedestrian)在预训练中比单调的自动驾驶基准更有效。
  • 提出并验证一种渐进式微调策略以提升泛化能力,倡导将跨数据集评估作为未来检测器开发的新标准。

提出的方法

  • 提出一种渐进式微调流程:在多样化、密集行人数据集(CrowdHuman、WiderPedestrian)上进行预训练,然后在目标数据集(CityPersons、EuroCityPersons)上进行微调。
  • 使用Cascade R-CNN作为检测头,以确保所有实验中评估的一致性,从而实现主干网络之间的公平比较。
  • 在相同检测头和训练协议下,对比CNN和Transformer主干网络(如ResNeXt、Swin-T)在泛化性能上的差异,以隔离主干架构对泛化的影响。
  • 采用集成推理方法,结合使用不同数据集(CrowdHuman + WiderPedestrian)预训练的模型的检测结果(通过soft-NMS),以提升鲁棒性。
  • 采用跨数据集评估作为主要评估协议,即在一个数据集上训练,在其他数据集上测试(如CrowdHuman → CityPersons),以衡量真正的泛化能力。
  • 使用官方基准中预留的测试集(CityPersons、EuroCityPersons)进行最终评估,以确保与已发表基线方法的可复现性和公平性。

实验结果

研究问题

  • RQ1当前最先进行人检测器在不同数据集之间的泛化能力如何,尤其是在小领域偏移情况下的表现?
  • RQ2行人检测器中的架构设计选择(如锚点设置)如何导致泛化能力差?
  • RQ3在跨数据集评估下,基于Transformer的主干网络是否比基于CNN的主干网络在行人检测中具有更好的泛化能力?
  • RQ4与单调的自动驾驶基准相比,来自网络爬取来源的大规模、多样化数据集(如CrowdHuman、WiderPedestrian)是否能提升泛化能力?
  • RQ5使用多样化数据集的渐进式预训练与微调流程是否能带来比仅在目标领域数据上标准训练更好的泛化效果?

主要发现

  • 尽管当前行人检测器在单一数据集基准上表现优异,但在跨数据集评估中性能显著下降,表明其泛化能力差。
  • 通用目标检测器(如Cascade R-CNN)在跨数据集评估中优于专用行人检测器,因其通用设计,表明过度专业化会损害泛化能力。
  • 在泛化能力方面,基于CNN的主干网络优于基于Transformer的主干网络,尽管Transformer在单个基准上表现更优,表明CNN对领域偏移更具鲁棒性。
  • 在CrowdHuman和WiderPedestrian等多样化、网络爬取的数据集上进行预训练,能显著提升泛化能力,将CityPersons合理集上的AP从8.35降至7.69(集成模型),ECP上的AP从5.5降至5.1。
  • 所提出的渐进式微调流程结合集成推理,在CityPersons和EuroCityPersons排行榜上分别获得第1名和第2名,优于所有仅使用官方训练数据的已发表方法。
  • 本研究发现,当前自动驾驶基准在场景多样性与行人密度方面较为单调,限制了在这些数据上训练的检测器的鲁棒性,并主张采用更多样化的预训练数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。