[论文解读] Embedded CNN based vehicle classification and counting in non-laned road traffic
本文提出了一种基于嵌入式CNN的系统,用于在德里-中央邦(Delhi-NCR)等非车道划分、异构交通环境中进行车辆分类与计数,采用自定义标注的5,562帧视频数据集进行训练。通过迁移学习与微调,该模型在测试中实现了最高75%的平均精度均值(mAP),而嵌入式实现则展现出适用于低连接性区域实际部署的低延迟与高能效特性。
Classifying and counting vehicles in road traffic has numerous applications in the transportation engineering domain. However, the wide variety of vehicles (two-wheelers, three-wheelers, cars, buses, trucks etc.) plying on roads of developing regions without any lane discipline, makes vehicle classification and counting a hard problem to automate. In this paper, we use state of the art Convolutional Neural Network (CNN) based object detection models and train them for multiple vehicle classes using data from Delhi roads. We get upto 75% MAP on an 80-20 train-test split using 5562 video frames from four different locations. As robust network connectivity is scarce in developing regions for continuous video transmissions from the road to cloud servers, we also evaluate the latency, energy and hardware cost of embedded implementations of our CNN model based inferences.
研究动机与目标
- 解决在德里-中央邦等发展中国家常见、非车道划分、异构交通环境中实现自动化车辆计数与分类的挑战。
- 通过创建针对特定领域的标注数据集,克服在西方交通数据集上微调的预训练CNN模型在本地区表现不佳的问题。
- 评估将训练好的CNN模型部署在嵌入式平台上的可行性,以实现在资源受限环境中的低延迟、低功耗推理。
- 通过利用路边摄像头实现准确、可扩展的交通监控,支持数据驱动的城市政策决策。
- 通过实现可扩展、低成本的交通监控系统,弥合信息通信技术(ICT)与城市发展之间的差距,助力城市基础设施规划。
提出的方法
- 从德里-中央邦的四个地点(包括交叉路口和高速公路)采集视频数据,使用路边和车载摄像头,配备鱼眼镜头和普通镜头。
- 在5,562帧中人工标注了32,088个目标,使用边界框标注八类车辆,包括两轮车、三轮车、小汽车、公共汽车和卡车。
- 使用ImageNet预训练模型并结合迁移学习,对Faster R-CNN或YOLO等目标检测模型进行微调,随后在自定义数据集上进行领域特定的微调。
- 采用80-20的训练-测试划分评估模型性能,以平均精度均值(mAP)为主要指标。
- 在嵌入式平台(如NVIDIA Jetson、Coral TPU)上测量推理延迟、功耗和硬件成本,以评估实时部署能力。
- 开展跨摄像头评估,以测试模型在不同摄像头角度、镜头类型和视角(正面、侧面、背面)下的泛化能力。
实验结果
研究问题
- RQ1基于CNN的目标检测模型是否能在德里-中央邦等非车道划分、异构交通环境中实现对多种车辆类型的高精度分类与计数?
- RQ2当在西方交通数据集(如PASCAL VOC、KITTI)上训练的模型应用于印度非车道划分交通环境时,性能如何下降?其原因是什么?
- RQ3与从西方数据集迁移学习相比,使用德里-中央邦自定义标注数据集在多大程度上能提升模型性能?
- RQ4在适用于路边交通监控的嵌入式系统上部署此类模型时,其延迟、功耗和硬件成本分别是多少?
- RQ5在真实城市部署中,模型在不同摄像头安装方式、镜头类型和视角下的泛化能力如何?
主要发现
- 所提出的模型在使用自定义标注的德里-中央邦数据集进行80-20划分训练-测试时,实现了最高75%的平均精度均值(mAP)。
- 在西方数据集(PASCAL VOC和KITTI)上微调的预训练模型在德里交通环境中的表现较差,分别仅达到0.58%和0.01%的mAP。
- 性能下降的原因包括车辆类型差异(如机动三轮车、电动三轮车)、缺乏车道规范导致的遮挡、不规则的交叉口几何结构,以及摄像头视角差异(驾驶员视角与路边视角)。
- 包含5,562帧和32,088个标注的自定义标注数据集在目标领域实现高精度方面起到了决定性作用。
- 训练模型的嵌入式实现展现出实用的延迟与能效表现,使在低连接性区域实现实时部署成为可能。
- 跨摄像头评估表明,基于某一类摄像头训练的模型在一定程度上具备良好的泛化能力,但性能随镜头类型和视角变化而波动,凸显了多样化训练数据的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。