Skip to main content
QUICK REVIEW

[论文解读] DriftNet: Aggressive Driving Behavior Classification using 3D EfficientNet Architecture

Alam Noor, Bilel Benjdira|arXiv (Cornell University)|Apr 18, 2020
Anomaly Detection Techniques and Applications参考文献 15被引用 5
一句话总结

本文提出 DriftNet,一种基于 3D EfficientNet 的深度学习模型,用于在视频序列中检测激进驾驶行为(如汽车漂移)。通过将 EfficientNet 架构适配至 3D 视频输入,并在新收集的沙特阿拉伯漂移视频数据集上应用迁移学习,DriftNet 仅用 469 万个参数即实现了 92.5% 的验证准确率,在准确率和参数效率方面均优于 C3D、ConvLSTM 和 DenseNet。

ABSTRACT

Aggressive driving (i.e., car drifting) is a dangerous behavior that puts human safety and life into a significant risk. This behavior is considered as an anomaly concerning the regular traffic in public transportation roads. Recent techniques in deep learning proposed new approaches for anomaly detection in different contexts such as pedestrian monitoring, street fighting, and threat detection. In this paper, we propose a new anomaly detection framework applied to the detection of aggressive driving behavior. Our contribution consists in the development of a 3D neural network architecture, based on the state-of-the-art EfficientNet 2D image classifier, for the aggressive driving detection in videos. We propose an EfficientNet3D CNN feature extractor for video analysis, and we compare it with existing feature extractors. We also created a dataset of car drifting in Saudi Arabian context https://www.youtube.com/watch?v=vLzgye1-d1k . To the best of our knowledge, this is the first work that addresses the problem of aggressive driving behavior using deep learning.

研究动机与目标

  • 为解决现有真实世界视频数据中缺乏基于深度学习的激进驾驶行为(如汽车漂移)检测方法的问题。
  • 开发一种专为视频异常检测优化的 3D 卷积神经网络架构,具备高效率与低参数量。
  • 创建并发布一个全新的、开源的沙特阿拉伯道路采集的汽车漂移视频数据集,以支持未来研究。
  • 通过在 3D EfficientNet 框架中应用迁移学习与复合缩放技术,提升检测性能,超越 C3D、ConvLSTM 和 DenseNet 等现有模型。
  • 实现在城市交通监控应用中,资源受限环境下的实时、高效部署激进驾驶检测系统。

提出的方法

  • 作者通过将 2D EfficientNet 主干网络扩展为处理时间视频片段的输入张量(形状为 N × C × T × H × W),设计了 3D EfficientNet-B0 架构(即 EfficientNet3D-B0)。
  • 模型采用迁移学习,使用 ImageNet 预训练权重初始化,并在自定义漂移视频数据集上进行微调。
  • 输入视频帧被缩放至 112×112 像素,并以 32 帧为序列采样,形成用于时间建模的 3D 输入体积。
  • 应用了数据增强技术,如水平翻转、光照调整、裁剪、切片和椒盐噪声,以提升泛化能力并减少过拟合。
  • 优化采用带有动量 0.5 和权重衰减 1e-7 的随机梯度下降(SGD),并使用早停法防止过拟合。
  • 模型在 NVIDIA RTX 2070 GPU 上使用 PyTorch,基于 80/20 的训练-测试划分,以批量大小 32 进行训练。

实验结果

研究问题

  • RQ13D 版本的 EfficientNet 架构是否能以高准确率和低计算成本有效检测视频序列中的汽车漂移?
  • RQ2与 C3D、ConvLSTM 和 DenseNet 等现有 3D CNN 模型相比,所提出的 DriftNet 模型在分类准确率和参数效率方面表现如何?
  • RQ3从 ImageNet 预训练进行迁移学习,在有限的自定义漂移视频数据集上能多大程度上提升性能?
  • RQ4EfficientNet 的复合缩放方法是否能良好泛化至 3D 视频动作识别任务,特别是针对如汽车漂移等罕见行为?
  • RQ5轻量级 3D CNN 是否能在资源受限的部署平台实现高性能检测?

主要发现

  • DriftNet 在自定义漂移视频数据集上实现了 92.5% 的验证准确率,分类性能优于 C3D、ConvLSTM 和 DenseNet。
  • 所提出的 EfficientNet3D-B0 模型在训练集上达到 93.75% 的准确率,表明其在训练数据上具备强大的学习能力。
  • 尽管参数量仅为 469 万个,DriftNet 在参数效率方面仍显著优于其他测试模型。
  • 模型性能在提升缩放因子(最高至 B7)后未见提升,表明 B0 对此特定数据集和任务为最优配置。
  • 数据增强与早停法有效缓解了过拟合,训练与验证准确率之间的差距较小。
  • 作者成功收集并发布了包含 100 段漂移视频和 100 段正常驾驶视频的全新开源数据集,为未来激进驾驶检测研究做出贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。