Skip to main content
QUICK REVIEW

[论文解读] iToF2dToF: A Robust and Flexible Representation for Data-Driven Time-of-Flight Imaging

Felipe Gutierrez, Huaijin Chen|arXiv (Cornell University)|Mar 11, 2021
Advanced Optical Sensing Technologies参考文献 60被引用 32
一句话总结

该论文提出 iToF2dToF,一种数据驱动方法,通过插值/外推频率从稀疏 iToF 频率测量中重建瞬态图像,从而实现基于规则的峰值检测的鲁棒深度估计。该方法在低信噪比及镜面多路径干扰(specular MPI)和光学串扰等挑战性场景下无需微调即可提升精度,在真实世界和合成数据上均优于先前方法,达到当前最先进水平。

ABSTRACT

Indirect Time-of-Flight (iToF) cameras are a promising depth sensing technology. However, they are prone to errors caused by multi-path interference (MPI) and low signal-to-noise ratio (SNR). Traditional methods, after denoising, mitigate MPI by estimating a transient image that encodes depths. Recently, data-driven methods that jointly denoise and mitigate MPI have become state-of-the-art without using the intermediate transient representation. In this paper, we propose to revisit the transient representation. Using data-driven priors, we interpolate/extrapolate iToF frequencies and use them to estimate the transient image. Given direct ToF (dToF) sensors capture transient images, we name our method iToF2dToF. The transient representation is flexible. It can be integrated with different rule-based depth sensing algorithms that are robust to low SNR and can deal with ambiguous scenarios that arise in practice (e.g., specular MPI, optical cross-talk). We demonstrate the benefits of iToF2dToF over previous methods in real depth sensing scenarios.

研究动机与目标

  • 解决数据驱动 iToF 方法在缺乏显式监督的模糊场景(如镜面多路径干扰和光学串扰)下的局限性。
  • 通过引入中间瞬态图像表示,克服端到端模型的泛化能力差的问题。
  • 利用灵活可学习的频率插值框架,在低信噪比条件下实现鲁棒深度估计。
  • 与简单的基于规则的峰值检测算法集成,以保持实时性能和适应性。
  • 在真实世界数据和包含真实噪声与复杂光传输的新合成数据集上展示卓越性能。

提出的方法

  • 将稀疏 iToF 频率测量(例如 20 MHz 和 100 MHz)输入深度神经网络,以实现频率的插值/外推。
  • 训练网络以预测一组密集的 iToF 频率(例如 20–400 MHz),从而支持高分辨率瞬态图像重建。
  • 利用重建的频率数据通过逆傅里叶变换估计直达反射(dToF)瞬态图像。
  • 对 dToF 波形应用基于规则的峰值检测算法(例如最大峰值检测)以提取深度估计。
  • 利用 dToF 表示分离直达光与间接光路径,从而在无需为每种场景显式监督的情况下减轻多路径干扰(MPI)。
  • 使用包含真实几何结构、纹理和噪声的合成数据集进行模型训练与验证,确保对真实世界条件的泛化能力。

实验结果

研究问题

  • RQ1与端到端模型相比,能够从稀疏 iToF 频率重建中间瞬态图像的数据驱动模型是否在模糊深度感知场景中具有更好的泛化能力?
  • RQ2在传统 iToF 和数据驱动方法失效的低信噪比条件下,iToF2dToF 框架表现如何?
  • RQ3dToF 表示是否能在无需微调的情况下,实现镜面反射和光学串扰等挑战性场景下的鲁棒深度估计?
  • RQ4与基线方法相比,所提出的频率插值策略在多大程度上提升了瞬态图像重建的精度?
  • RQ5将 iToF2dToF 与简单的基于规则的峰值检测集成后,其在真实世界数据上的深度精度是否优于端到端学习方法?

主要发现

  • 在具有真实深度标签的真实场景中,iToF2dToF 在深度精度方面达到当前最先进水平,优于传统相位法和数据驱动的 iToF2Depth 方法。
  • 在 0.1ms 曝光时间(极低信噪比)下,iToF2dToF 在其他方法失效或产生显著误差的区域仍能保持准确的深度估计。
  • 在包含镜面反射和光学串扰的挑战性场景中,iToF2dToF 相较于 iToF2Depth 将中位数深度误差降低了高达 50%。
  • 包含真实噪声与复杂光传输的合成数据集有效支持了模型训练,并实现了向真实世界场景的良好泛化。
  • 即使仅输入两个频率,iToF2dToF 也能成功重建瞬态波形且伪影极少,从而生成高质量深度图。
  • 该框架在不同雾密度条件下均保持鲁棒性,即使在高散射条件下也能实现准确的深度恢复。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。