Skip to main content
QUICK REVIEW

[论文解读] FoveaNet: Perspective-aware Urban Scene Parsing

Xin Li, Zequn Jie|arXiv (Cornell University)|Aug 8, 2017
Advanced Neural Network Applications参考文献 34被引用 9
一句话总结

FoveaNet 提出了一种视角感知的深度学习框架,用于城市场景解析,通过显式建模相机视角几何结构来解决车载摄像头图像中的尺度异质性问题。通过卷积神经网络估计视角得分,并应用尺度归一化和视角感知的条件随机场(CRF),FoveaNet 在 Cityscapes 和 CamVid 数据集上实现了最先进性能,显著降低了小物体的边界误差以及大范围周边物体的“破碎化”错误。

ABSTRACT

Parsing urban scene images benefits many applications, especially self-driving. Most of the current solutions employ generic image parsing models that treat all scales and locations in the images equally and do not consider the geometry property of car-captured urban scene images. Thus, they suffer from heterogeneous object scales caused by perspective projection of cameras on actual scenes and inevitably encounter parsing failures on distant objects as well as other boundary and recognition errors. In this work, we propose a new FoveaNet model to fully exploit the perspective geometry of scene images and address the common failures of generic parsing models. FoveaNet estimates the perspective geometry of a scene image through a convolutional network which integrates supportive evidence from contextual objects within the image. Based on the perspective geometry information, FoveaNet "undoes" the camera perspective projection analyzing regions in the space of the actual scene, and thus provides much more reliable parsing results. Furthermore, to effectively address the recognition errors, FoveaNet introduces a new dense CRFs model that takes the perspective geometry as a prior potential. We evaluate FoveaNet on two urban scene parsing datasets, Cityspaces and CamVid, which demonstrates that FoveaNet can outperform all the well-established baselines and provide new state-of-the-art performance.

研究动机与目标

  • 解决通用语义分割模型在因视角引起的尺度异质性影响下,对城市场景图像表现不佳的问题。
  • 克服在第一视角相机视角下,远距离小尺度物体的解析失败以及大尺度近景物体的“破碎化”错误。
  • 将视角几何结构作为结构先验,以提升像素级和实例级解析的准确性。
  • 开发一个统一框架,整合视角估计、尺度归一化和自适应 CRF 推理,实现鲁棒的场景解析。

提出的方法

  • 使用卷积神经网络(CNN)训练视角估计网络(PEN),为每个像素预测密集的视角得分,以指示其与消失点的距离。
  • 对中央区域(即fovea区域)应用尺度归一化,以统一远距离小物体的尺度,提升其解析的可靠性。
  • 设计一个双分支全卷积网络(FCN)架构:一个粗粒度分支用于一般分割,一个fovea分支用于处理经视角归一化的特征。
  • 引入一种视角感知的密集CRF模型,将视角得分作为先验势,实现自适应平滑,从而保留小物体的边界。
  • 优化CRF时采用一种势函数,对视角得分高的像素(远距离物体)应用较弱的平滑,对得分低的像素(近距离物体)应用较强的平滑。
  • 在 Cityscapes 和 CamVid 上通过多尺度监督和基于CRF的优化,对整个 FoveaNet 架构进行端到端的微调。

实验结果

研究问题

  • RQ1建模视角几何结构是否能显著提升第一视角相机拍摄的城市场景的语义解析性能?
  • RQ2视角感知的尺度归一化在透视投影中对远距离小物体的解析准确性有何影响?
  • RQ3与标准CRF相比,视角感知的CRF在多大程度上能减少大范围周边物体的“破碎化”分割错误?
  • RQ4与深度预测相比,视角估计作为先验在减少城市场景中的分割伪影方面是否更有效?

主要发现

  • FoveaNet 在 Cityscapes 测试集上实现了最先进性能,平均交并比(mIoU)达到 89.3%,实例级交并比(iIoU)达到 77.6%,优于先前的最先进方法。
  • 在 Cityscapes 上,FoveaNet 相较基线 FCN 模型,实例级 IoU 最高提升 5.2%,表明其在小尺度物体处理方面具有显著优势。
  • 在 CamVid 上,FoveaNet 达到 93.3% 的全局准确率和 81.8% 的平均准确率,分别优于最佳基线 1.7 和 3.7 个百分点。
  • 消融实验表明,视角感知的CRF在不造成小物体过度平滑的前提下,有效减少了“破碎化”错误,优于标准CRF和深度感知CRF。
  • 视角估计网络成功捕捉了全局场景几何结构,视角得分越高,表示距离相机越远,相关性显著。
  • 视角感知归一化与自适应CRF推理的结合,在两个数据集上均带来了在多种评估指标下的稳定性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。