Skip to main content
QUICK REVIEW

[论文解读] Layered Interpretation of Street View Images

Ming-Yu Liu, Shuoxin Lin|arXiv (Cornell University)|Jun 15, 2015
Video Surveillance and Tracking Methods参考文献 29被引用 8
一句话总结

该论文提出了一种四层街景模型,通过立体图像联合估计语义标签(例如地面、车辆、行人、建筑物、天空)和深度。该方法采用深度神经网络提取外观特征,并利用基于动态规划的推理算法强制实施分层约束,在GPU上实现8.8 fps的推理速度,达到86.3%的IoU,为当前最优性能。

ABSTRACT

We propose a layered street view model to encode both depth and semantic information on street view images for autonomous driving. Recently, stixels, stix-mantics, and tiered scene labeling methods have been proposed to model street view images. We propose a 4-layer street view model, a compact representation over the recently proposed stix-mantics model. Our layers encode semantic classes like ground, pedestrians, vehicles, buildings, and sky in addition to the depths. The only input to our algorithm is a pair of stereo images. We use a deep neural network to extract the appearance features for semantic classes. We use a simple and an efficient inference algorithm to jointly estimate both semantic classes and layered depth values. Our method outperforms other competing approaches in Daimler urban scene segmentation dataset. Our algorithm is massively parallelizable, allowing a GPU implementation with a processing speed about 9 fps.

研究动机与目标

  • 解决在城市街景中联合估计语义分割与深度的挑战,提升几何一致性。
  • 通过强制实施反映真实道路场景几何结构的分层场景结构,克服单像素语义分割的局限性。
  • 开发一种高效、可并行化的推理算法,联合优化语义标签与深度,利用立体视差和深度外观特征。
  • 在不依赖昂贵硬件(如FPGA)或视频序列的时间约束条件下,实现高精度。

提出的方法

  • 构建联合能量最小化函数,结合来自立体视差代价体的深度线索与来自左立体图像上深度神经网络(DNN)的语义线索。
  • 定义四层场景模型:底层为地面,动态物体(车辆、行人),建筑物,顶层为天空,每列图像的深度随高度递增。
  • 使用动态规划高效最小化能量函数,强制实施分层约束并确保几何合理性。
  • 整合预训练DNN的外观特征与立体匹配的深度特征,计算每个像素的语义得分与深度值。
  • 在GPU上实现推理流水线,通过图像列并行化处理,实现实时性能,约8.8 fps。
  • 在评估阶段应用后处理步骤,将预测结果上采样至原始分辨率。

实验结果

研究问题

  • RQ1通过强制实施几何一致性,分层场景表示是否能提升城市街景中语义分割的准确性?
  • RQ2利用立体数据联合优化语义标签与深度的方法,与将两项任务分开处理的方法相比有何差异?
  • RQ3与仅依赖外观的模型相比,分层约束在多大程度上减少了几何上不可能的预测(如天空中的车辆)?
  • RQ4一种高效、支持GPU并行化的推理算法是否能在不使用FPGA或时间依赖关系的前提下实现实时性能并保持高精度?

主要发现

  • 所提方法在Daimler城市场景分割数据集上达到86.3%的平均交并比(IoU),优于ALE(86.0%)和stix-mantics(80.6%)。
  • 对于动态物体(车辆与行人),该方法达到77.2%的IoU,超过ALE的74.5%,表明对移动障碍物的处理能力更强。
  • 与仅依赖外观的深度学习方法相比,分层约束使错误率降低20.3%(IoU从82.8%提升至86.3%),证明其在消除几何不一致预测方面的有效性。
  • 该算法在GPU上运行速度为8.8帧每秒,显著快于ALE(每帧111,000 ms),与stix-mantics(50 ms)相当,尽管后者使用FPGA预计算深度。
  • 该方法对桥梁或隧道等复杂场景具有鲁棒性,可通过GPS检测并借助扩展分层结构进行处理。
  • 各组件耗时分别为:DNN推理70.0 ms,深度代价体5.2 ms,中间表计算25.6 ms,推理13.3 ms,GPU上每帧总耗时114.1 ms。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。