Skip to main content
QUICK REVIEW

[论文解读] Breaking the Spatio-Angular Trade-off for Light Field Super-Resolution via LSTM Modelling on Epipolar Plane Images

Hao Zhu, Mantang Guo|arXiv (Cornell University)|Feb 15, 2019
Advanced Vision and Imaging参考文献 29被引用 6
一句话总结

该论文提出了一种新颖的CNN-LSTM框架用于光场超分辨率,通过将同向平面图像(EPIs)建模为二维序列,打破了传统空间-角度分辨率权衡。该方法利用EPI中的几何连续性而非语义内容,实现了最先进性能,尤其在大视差区域表现优异,相比以往基于学习的方法提升超过3dB。

ABSTRACT

Light-field cameras (LFC) have received increasing attention due to their wide-spread applications. However, current LFCs suffer from the well-known spatio-angular trade-off, which is considered as an inherent and fundamental limit for LFC designs. In this paper, by doing a detailed geometrical optical analysis of the sampling process in an LFC, we show that the effective sampling resolution is generally higher than the number of micro-lenses. This contribution makes it theoretically possible to break the resolution trade-off. Our second contribution is an epipolar plane image (EPI) based super-resolution method, which can super-resolve the spatial and angular dimensions simultaneously. We prove that the light field is a 2D series, thus, a specifically designed CNN-LSTM network is proposed to capture the continuity property of the EPI. Rather than leveraging semantic information, our network focuses on extracting geometric continuity in the EPI. This gives our method an improved generalization ability and makes it applicable to a wide range of previously unseen scenes. Experiments on both synthetic and real light fields demonstrate the improvements over state-of-the-art, especially in large disparity areas.

研究动机与目标

  • 为克服光场相机(LFCs)中固有的空间-角度分辨率权衡问题,该问题限制了同时实现高空间与高角度分辨率。
  • 开发一种基于学习的方法,通过同向平面图像(EPIs)联合超分重建光场的空间与角度维度。
  • 通过聚焦几何连续性而非语义内容,提升在多样化、此前未见过的场景中的泛化能力。
  • 解决现有基于深度和基于EPI的方法的局限性,特别是大视差区域的伪影以及EPI一致性损失问题。
  • 从理论和实证上验证,在离焦条件下,光场相机的有效采样分辨率可超过微透镜数量。

提出的方法

  • 该方法对LFC采样进行了几何光学分析,表明在离焦情况下,有效空间采样分辨率可超过微透镜数量。
  • 将光场建模为同向平面图像(EPIs)的二维序列,利用不同视角间同向线的连续性。
  • 提出一种专门设计的CNN-LSTM网络,以捕捉EPI中的几何连续性,其中LSTM用于建模二维EPI序列中的时序依赖性。
  • 网络专注于插值几何结构,而非依赖语义填充,从而增强对未见场景的泛化能力。
  • 采用剪切变换的数据增强方法,提升对正负视差的鲁棒性。
  • 该方法使用二维序列模型,统一表示连续与离散的同向线,实现一致的EPI超分辨率。

实验结果

研究问题

  • RQ1通过分析离焦情况下的有效采样分辨率,能否在理论上克服光场相机中的空间-角度权衡?
  • RQ2能否将同向平面图像(EPIs)建模为二维序列,以利用几何连续性实现超分辨率?
  • RQ3一种聚焦于几何连续性的CNN-LSTM架构,是否优于依赖语义内容或深度估计的方法?
  • RQ4在EPI一致性较弱的高视差区域,该方法表现如何?
  • RQ5该方法能否在无需微调的情况下,有效泛化至此前未见的场景?

主要发现

  • 与最先进方法相比,该方法在PSNR上提升超过3dB,迪士尼数据集上峰值达到32.17dB,而EPICNN为28.77dB。
  • 在高视差区域(如图11(a)中的铲子边界),该方法能保持清晰的物体边界,而EPICNN产生严重伪影。
  • 该方法在正负视差区域均保持一致性能,而LFST在负视差区域引入伪影。
  • 即使在EPI一致性较弱的大视差区域,该方法仍能生成高质量重建视图,表明对EPI不连续性的鲁棒性。
  • 性能随分辨率增加而提升,随视差增大而下降,但该方法在所有设置下仍优于基线方法,尤其在高缩放因子下表现更优。
  • 重建的EPI在低视差和高视差情况下均非常接近真实值,证实了模型保持几何结构的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。