Skip to main content
QUICK REVIEW

[论文解读] FishEyeRecNet: A Multi-Context Collaborative Deep Network for Fisheye Image Rectification

Xiaoqing Yin, Xinchao Wang|arXiv (Cornell University)|Apr 13, 2018
Optical measurement and interference techniques参考文献 14被引用 6
一句话总结

本文提出 FishEyeRecNet,一种端到端深度学习框架,通过融合低层次外观特征与高层次语义分割,联合估计畸变参数并执行鱼眼图像矫正。通过利用具有语义引导的多上下文协作网络,该方法在合成数据集和真实世界鱼眼数据集上均实现了最先进性能,相较于以往基于手工特征的方法,在定量指标和定性结果上均有超越,同时保持了实时推理速度。

ABSTRACT

Images captured by fisheye lenses violate the pinhole camera assumption and suffer from distortions. Rectification of fisheye images is therefore a crucial preprocessing step for many computer vision applications. In this paper, we propose an end-to-end multi-context collaborative deep network for removing distortions from single fisheye images. In contrast to conventional approaches, which focus on extracting hand-crafted features from input images, our method learns high-level semantics and low-level appearance features simultaneously to estimate the distortion parameters. To facilitate training, we construct a synthesized dataset that covers various scenes and distortion parameter settings. Experiments on both synthesized and real-world datasets show that the proposed model significantly outperforms current state of the art methods. Our code and synthesized dataset will be made publicly available.

研究动机与目标

  • 为解决基于手工特征的方法在鱼眼图像矫正中的局限性,这些方法常因表达能力有限而产生不可靠结果。
  • 开发一种端到端可训练的深度神经网络,通过结合低层次和高层次特征,联合估计畸变参数并执行图像矫正。
  • 将语义理解融入矫正过程,以指导畸变校正,尤其用于区分人造结构与自然物体。
  • 构建一个高质量、多样化的合成鱼眼数据集,包含真实矫正图像和场景解析标签,以实现有效训练。
  • 实现适用于虚拟现实、监控和自动驾驶等实际计算机视觉应用的实时、高精度矫正。

提出的方法

  • 该模型采用具有三个子网络的多上下文协作架构:特征提取主干网络、用于高层次语义的场景解析网络,以及畸变参数估计网络。
  • 通过深度卷积神经网络提取低层次特征,同时通过场景解析分支学习高层次语义,以指导畸变估计。
  • 通过融合低层次特征与语义监督来估计畸变参数,从而实现对鱼眼图像成像过程更精确的建模。
  • 采用可微分的畸变矫正层,同时对输入图像和场景解析图应用估计的参数进行仿射变换。
  • 整个网络在合成数据集上通过结合重建损失与分割损失的损失函数进行端到端训练。
  • 合成数据集通过在 ADE20K 上应用具有可调参数的各种鱼眼畸变模型生成,增强了数据的多样性与真实性。

实验结果

研究问题

  • RQ1基于深度学习的模型若能同时学习外观特征与语义特征,是否能在鱼眼图像矫正中超越传统手工特征方法?
  • RQ2语义监督在多大程度上提升了鱼眼图像中畸变参数估计的准确性?
  • RQ3场景解析的整合在多大程度上提升了矫正图像的质量,特别是在复杂城市场景中?
  • RQ4一个包含多样化畸变参数与语义标签的合成数据集,是否能有效训练出泛化能力强的矫正模型?
  • RQ5所提出的端到端、多上下文协作网络是否在保持高精度的同时实现了实时推理?

主要发现

  • 所提出的 FishEyeRecNet 在合成与真实世界鱼眼数据集上均表现出优越性能,在 PSNR 与 SSIM 指标上超越了最先进方法。
  • 引入语义引导显著提升了矫正质量,尤其在保持建筑物与车辆等人造结构的直线边界方面表现更优。
  • 即使不使用场景解析模块,该模型仍优于现有方法,但加入语义监督后性能进一步提升。
  • 该模型在 K80 GPU 上推理耗时 1.31 秒,显著快于 [10] 和 [15] 等迭代方法在 CPU 上超过 60 秒的处理时间。
  • 合成数据集有效支持了模型训练,且模型在常见语义类别上泛化良好,但对未见类别的性能仍具挑战。
  • 该方法在多样化场景与畸变参数下表现出鲁棒性,定性结果表明能准确校正复杂畸变。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。