Skip to main content
QUICK REVIEW

[论文解读] Understanding Traffic Density from Large-Scale Web Camera Data

Shanghang Zhang, Guanhang Wu|arXiv (Cornell University)|Mar 17, 2017
Video Surveillance and Tracking Methods参考文献 25被引用 13
一句话总结

本文提出两种方法——基于优化的秩约束回归(OPT-RC)和采用多任务学习的全卷积网络(FCN-MT)——从低分辨率、高遮挡、大视角畸变的网络摄像头视频中估计车辆密度,而无需检测或追踪单个车辆。FCN-MT在TRANCOS数据集上的平均绝对误差(MAE)降低至5.31,显著优于当前最先进基线方法。

ABSTRACT

Understanding traffic density from large-scale web camera (webcam) videos is a challenging problem because such videos have low spatial and temporal resolution, high occlusion and large perspective. To deeply understand traffic density, we explore both deep learning based and optimization based methods. To avoid individual vehicle detection and tracking, both methods map the image into vehicle density map, one based on rank constrained regression and the other one based on fully convolution networks (FCN). The regression based method learns different weights for different blocks in the image to increase freedom degrees of weights and embed perspective information. The FCN based method jointly estimates vehicle density map and vehicle count with a residual learning framework to perform end-to-end dense prediction, allowing arbitrary image resolution, and adapting to different vehicle scales and perspectives. We analyze and compare both methods, and get insights from optimization based method to improve deep model. Since existing datasets do not cover all the challenges in our work, we collected and labelled a large-scale traffic video dataset, containing 60 million frames from 212 webcams. Both methods are extensively evaluated and compared on different counting tasks and datasets. FCN based method significantly reduces the mean absolute error from 10.99 to 5.31 on the public dataset TRANCOS compared with the state-of-the-art baseline.

研究动机与目标

  • 解决从大规模、低质量的网络摄像头视频中估计交通密度的挑战,这些视频具有低分辨率、高遮挡和大视角畸变。
  • 克服基于检测和基于运动的方法在视频质量差和帧率低时失效的局限性。
  • 开发一种整体性方法,避免对单个车辆进行检测或追踪,专注于从图像特征直接估计密度。
  • 构建一个大规模的真实世界网络摄像头数据集,包含6000万帧和46,796个标注车辆,以支持评估与基准测试。
  • 通过从基于优化的方法中获得的洞见,改进深度学习模型,提升对视角和尺度变化的鲁棒性。

提出的方法

  • OPT-RC使用秩约束回归为图像块学习不同权重,嵌入道路几何信息并减少视角引起的误差。
  • 该方法先应用背景减除和SIFT特征,再通过低秩约束将块级特征映射到车辆密度,以保证空间一致性。
  • FCN-MT用全卷积网络替代手工设计的组件,实现密度图与前景掩码的端到端学习。
  • 它采用残差学习框架,联合估计车辆密度与数量,支持任意输入分辨率并适应尺度变化。
  • 该模型使用转置卷积层上采样特征图,生成与输入分辨率匹配的密集预测输出。
  • 两种方法均避免对象级检测或追踪,专注于图像级整体回归至车辆密度。

实验结果

研究问题

  • RQ1基于秩约束的优化框架能否有效建模低分辨率、高遮挡的网络摄像头视频中的交通密度,同时处理大视角畸变?
  • RQ2与传统基于优化的方法相比,采用多任务学习的端到端深度学习在车辆密度估计方面有何改进?
  • RQ3基于优化的方法(OPT-RC)的洞见在多大程度上能提升深度学习模型(FCN-MT)的设计与性能?
  • RQ4所提出的方法在面对不同真实世界网络摄像头场景中车辆尺度、视角和图像质量变化时,其鲁棒性如何?
  • RQ5所提出的方法能否泛化至交通计数以外的其他计数任务,例如人群计数?

主要发现

  • FCN-MT在TRANCOS数据集上的平均绝对误差(MAE)降低至5.31,显著优于当前最先进基线方法(MAE = 10.99)。
  • FCN-MT模型优于单任务FCN-ST和所有基线方法,证明了多任务学习在密度估计中的有效性。
  • OPT-RC实现了具有竞争力的性能(MAE = 12.41),并优于非深度学习基线方法,验证了其对视角和遮挡的鲁棒性。
  • 在UCSD人群计数数据集上,FCN-MT实现了MAE = 1.67,与当前最先进深度学习方法(如Cross-scene DNN,MAE = 1.60)相当。
  • FCN-MT模型通过学习判别性层次特征,消除了对背景减除的依赖,而OPT-RC则严重依赖背景减除。
  • 尽管存在轻微伪影(如棋盘状图案),FCN-MT在不同计数任务和相机配置下仍表现出良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。