Skip to main content
QUICK REVIEW

[论文解读] Highway Driving Dataset for Semantic Video Segmentation

Byungju Kim, Junho Yim|arXiv (Cornell University)|Nov 2, 2020
Advanced Image and Video Retrieval Techniques被引用 15
一句话总结

本文介绍了Highway Driving数据集,这是一个用于语义视频分割的时序和空间密集视频基准数据集,包含20个高帧率(30Hz)序列,均进行了像素级别的全量标注。本文提出了一种轻量级、循环的基线模型,通过利用时序相关性实现实时推理,同时保持了较高的准确性,显著降低了运行时间,通过控制预热频率来维持性能。

ABSTRACT

Scene understanding is an essential technique in semantic segmentation. Although there exist several datasets that can be used for semantic segmentation, they are mainly focused on semantic image segmentation with large deep neural networks. Therefore, these networks are not useful for real time applications, especially in autonomous driving systems. In order to solve this problem, we make two contributions to semantic segmentation task. The first contribution is that we introduce the semantic video dataset, the Highway Driving dataset, which is a densely annotated benchmark for a semantic video segmentation task. The Highway Driving dataset consists of 20 video sequences having a 30Hz frame rate, and every frame is densely annotated. Secondly, we propose a baseline algorithm that utilizes a temporal correlation. Together with our attempt to analyze the temporal correlation, we expect the Highway Driving dataset to encourage research on semantic video segmentation.

研究动机与目标

  • 解决自动驾驶场景中缺乏时序密集视频分割数据集的问题。
  • 通过减少推理时间,在不牺牲准确性的前提下实现实时语义视频分割。
  • 提供一个具有高时空标注密度的基准数据集,用于视频分割研究。
  • 开发一种利用时序相关性来加速推理的基线算法。
  • 证明可通过利用时序一致性,减少对每帧昂贵深层网络的依赖。

提出的方法

  • 从高速公路驾驶场景中采集20个高帧率(30Hz)视频序列,并进行密集的像素级标注。
  • 按顺序标注帧,以确保相邻帧之间的时序一致性。
  • 提出一个双分支网络:一个慢速但准确的预热网络和一个快速但轻量的近似网络。
  • 使用循环框架,通过近似网络将预热网络的预测结果传播到后续帧。
  • 通过调整预热网络推理的频率来控制推理速度,平衡准确性和运行时间。
  • 使用知识蒸馏和时序一致性损失,训练近似网络以模仿预热网络的输出。

实验结果

研究问题

  • RQ1通过利用时序相关性,视频分割模型是否能在最小化运行时间的同时实现高准确性?
  • RQ2标注中的时序密度在多大程度上影响语义视频分割模型的性能和可靠性?
  • RQ3当由更深层、更准确的网络周期性提供预测结果时,轻量级网络在多大程度上能保持准确性?
  • RQ4是否可能设计一个实现实时语义视频分割的系统,其性能可与最先进模型相媲美?
  • RQ5预热频率在多大程度上影响推理速度与分割准确性的权衡?

主要发现

  • Highway Driving数据集提供了20个视频序列,帧率为30Hz,且具有全量像素级标注,其时序密度高于现有数据集(如CamVid,1Hz)。
  • 所提出的基线算法在显著降低运行时间的同时,性能与更强模型相当,且性能可通过预热频率进行调节。
  • 即使在59帧内未重新预热,该算法仍能保持高质量的预测结果,证明了通过循环框架实现有效时序传播。
  • 定性结果表明,该模型能保持场景一致性,并准确分割运动物体,尤其在存在密集时序标注时表现更优。
  • 该算法泛化能力良好,经验证在CamVid数据集上表现一致,无需微调即可在不同数据集上保持稳定性能。
  • 运行时间以DRN为基准进行归一化;基线模型在保持竞争性准确性的前提下,推理速度优于标准模型,证明了利用时序相关性可有效降低计算负载。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。