Skip to main content
QUICK REVIEW

[论文解读] Video Contents Understanding using Deep Neural Networks

Mohammadhossein Toutiaee, Abbas Keshavarzi|arXiv (Cornell University)|Apr 29, 2020
Video Surveillance and Tracking Methods参考文献 18被引用 7
一句话总结

本论文提出了一种基于迁移学习的视频分类框架,利用预训练的VGG-19和自定义CNN模型,从视频帧中分类交通拥堵等级(低、中、高),在能见度降低的视觉条件下(如雾天和雨天)显著优于基于目标检测的方法(如YOLO9000和Google Video Intelligence API),表现出更优的准确性。

ABSTRACT

We propose a novel application of Transfer Learning to classify video-frame sequences over multiple classes. This is a pre-weighted model that does not require to train a fresh CNN. This representation is achieved with the advent of "deep neural network" (DNN), which is being studied these days by many researchers. We utilize the classical approaches for video classification task using object detection techniques for comparison, such as "Google Video Intelligence API" and this study will run experiments as to how those architectures would perform in foggy or rainy weather conditions. Experimental evaluation on video collections shows that the new proposed classifier achieves superior performance over existing solutions.

研究动机与目标

  • 解决在视觉质量差及雾、雨等恶劣天气条件下对视频中交通拥堵等级进行分类的挑战。
  • 克服传统基于运动或统计模型的局限性,这些模型需要大量参数调优,且在图像退化时性能下降。
  • 开发一种视频分类系统,通过利用预训练的深度神经网络,避免从零开始训练新CNN。
  • 提升对视觉上相似的类别(中等与重拥堵交通)的分类准确性,因为现有方法在外观和车辆数量重叠时表现困难。
  • 证明使用预训练模型的迁移学习方法可在极少超参数调优和计算成本下实现最先进性能。

提出的方法

  • 利用预训练的VGG-19和一个自定义的5层CNN作为特征提取器,避免从头训练新的CNN。
  • 从VGG-19的瓶颈层(fc2)和CNN的最后一个全连接层提取迁移特征,每帧生成25,088维和12,544维的特征向量。
  • 将这些高维迁移特征存储在磁盘上,避免在分类过程中重复计算。
  • 应用主成分分析(PCA),n=2,以降低维度,用于可视化和分析,从而在潜在空间中解释类别可分性。
  • 在降维后的迁移特征上训练分类器,以预测交通拥堵等级(低、中、高)。
  • 在包含退化帧和恶劣天气条件的真实交通视频数据集上,与基于目标检测的方法(YOLO9000和Google Video Intelligence API)进行性能对比。

实验结果

研究问题

  • RQ1在视觉质量差的条件下,使用预训练深度神经网络的迁移学习是否能比基于目标检测的方法更准确地分类交通拥堵等级?
  • RQ2VGG-19和自定义CNN在雾、雨和低分辨率等图像退化条件下的视频帧上,与传统统计或运动模型相比,泛化能力如何?
  • RQ3中等和重拥堵交通类别在特征空间中的重叠程度如何?模型是否能在视觉相似的情况下可靠地区分它们?
  • RQ4与从零开始训练CNN相比,使用预训练模型是否显著减少了超参数调优和训练时间?
  • RQ5PCA在高维迁移特征空间中对视频分类任务的类别可分性可视化效果如何?

主要发现

  • VGG-19迁移学习模型的分类准确率达到98.50%,显著优于最先进方法KL-SVM(94.50%)。
  • 所提方法对图像退化具有鲁棒性,在雾天和雨天等恶劣天气条件下仍保持高准确率,而目标检测模型则失效。
  • YOLO9000在各帧中检测到的车辆数量多于Google Video Intelligence API,但后者更易于使用;然而,两者在性能上均不及VGG-19迁移学习模型。
  • 自定义CNN模型表现良好,但准确率低于VGG-19,归因于其更简单的架构和更少的参数。
  • PCA可视化显示,低拥堵类别与中、高拥堵类别明显可分,而中、高拥堵类别存在部分重叠,表明该分类任务具有挑战性但可解决。
  • 迁移学习方法相比从零开始训练CNN,显著减少了超参数调优和计算成本,同时仍实现了最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。