[论文解读] Smart City Transportation: Deep Learning Ensemble Approach for Traffic Accident Detection
本文提出了一种轻量级的 I3D-CONVLSTM2D 模型,融合 RGB 视频帧与光流信息,实现在智慧城市中的实时交通事故检测。该模型在自建的精选数据集上进行训练,实现了 87% 的平均平均精度(MAP),优于基线模型,且针对树莓派等边缘设备的部署进行了优化。
The dynamic and unpredictable nature of road traffic necessitates effective accident detection methods for enhancing safety and streamlining traffic management in smart cities. This paper offers a comprehensive exploration study of prevailing accident detection techniques, shedding light on the nuances of other state-of-the-art methodologies while providing a detailed overview of distinct traffic accident types like rear-end collisions, T-bone collisions, and frontal impact accidents. Our novel approach introduces the I3D-CONVLSTM2D model architecture, a lightweight solution tailored explicitly for accident detection in smart city traffic surveillance systems by integrating RGB frames with optical flow information. Our experimental study's empirical analysis underscores our approach's efficacy, with the I3D-CONVLSTM2D RGB + Optical-Flow (Trainable) model outperforming its counterparts, achieving an impressive 87\% Mean Average Precision (MAP). Our findings further elaborate on the challenges posed by data imbalances, particularly when working with a limited number of datasets, road structures, and traffic scenarios. Ultimately, our research illuminates the path towards a sophisticated vision-based accident detection system primed for real-time integration into edge IoT devices within smart urban infrastructures.
研究动机与目标
- 开发一种实时、计算高效的事故检测系统,适用于在智慧城市基础设施中的边缘物联网设备上部署。
- 通过从交通监控和行车记录仪视频中整理出专用基准数据集,解决现有事故检测数据集中数据不平衡和多样性不足的问题。
- 通过新颖的深度学习架构,融合 RGB 帧与光流信息的时空特征,提升检测精度。
- 区分真实的交通事故与类似外观的事件(如静止车辆或缓慢行驶的车流),增强系统鲁棒性。
- 提供一种轻量级、可训练的替代方案,以替代 I3D 等重型模型,实现在资源受限硬件上的实际应用。
提出的方法
- 所提出的 I3D-CONVLSTM2D 模型结合了 3D 卷积神经网络(I3D)与 ConvLSTM2D 层,用于从视频序列中提取时空特征。
- 该模型同时处理 RGB 帧与光流输入,通过特征融合增强对动态事故相关运动的检测能力。
- 采用迁移学习,使用在 Kinetics 数据集上预训练的 I3D 权重,以改善特征表示并减少训练时间。
- 采用双流架构,RGB 与光流输入分别通过独立分支处理,随后在分类前进行晚期融合。
- 模型在包含 1,000+ 个视频片段的自建数据集上进行训练,涵盖多种事故类型(追尾、T 型碰撞、正面撞击)和道路状况。
- 通过模型压缩技术优化推理过程,实现边缘设备部署,RGB + 光流变体的总参数量为 900 万。

实验结果
研究问题
- RQ1仅使用监控摄像头提供的 RGB 和光流输入,轻量级深度学习模型能否有效实现实时交通交通事故检测?
- RQ2RGB 与光流的融合相比单独使用任一模态,能在多大程度上提升事故检测的准确性?
- RQ3自建的精选数据集在多大程度上能提升模型对罕见事故类型的泛化能力和性能表现?
- RQ4I3D-CONVLSTM2D 架构在准确率和计算效率方面,相比现有最先进模型有何优势?
- RQ5该系统的主要失效模式是什么?在实际部署中应如何缓解?
主要发现
- I3D-CONVLSTM2D RGB + 光流(可训练)模型实现了 87% 的平均平均精度(MAP),显著优于其他基线模型。
- 该模型在事故事件分类中表现出 80% 的准确率,而基于 Transformer 的变体在精度、召回率和 F1 分数上均为 75%,尽管训练时间更长。
- 轻量级架构仅含 900 万个参数,成功在 2 块 GPU(每块 11 GB)的配置上完成训练,支持高效的边缘设备部署。
- 研究发现,静止车辆和缓慢行驶的车流常引发误报,表明需要提升对上下文的理解能力。
- 环境因素如灰尘、烟雾和能见度降低会降低模型性能,凸显了提升鲁棒性的必要性。
- 所整理的涵盖多样化事故场景和道路类型的自建数据集在训练和泛化方面具有重要价值,为未来研究提供了资源。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。