[论文解读] Video super-resolution for single-photon LIDAR
本文提出一种用于单光子LIDAR深度数据的3D卷积神经网络(CNN)视频超分辨率与去噪方法,通过在基于SPAD的合成深度序列上进行训练,将低分辨率、噪声严重的图像帧放大4倍。该方法实现每秒超过30帧的实时性能(GPU上),在PSNR和SSIM指标上显著优于当前最先进方法,即使在未微调的情况下应用于真实实验数据也表现优异。
3D Time-of-Flight (ToF) image sensors are used widely in applications such as self-driving cars, Augmented Reality (AR) and robotics. When implemented with Single-Photon Avalanche Diodes (SPADs), compact, array format sensors can be made that offer accurate depth maps over long distances, without the need for mechanical scanning. However, array sizes tend to be small, leading to low lateral resolution, which combined with low Signal-to-Noise Ratio (SNR) levels under high ambient illumination, may lead to difficulties in scene interpretation. In this paper, we use synthetic depth sequences to train a 3D Convolutional Neural Network (CNN) for denoising and upscaling (x4) depth data. Experimental results, based on synthetic as well as real ToF data, are used to demonstrate the effectiveness of the scheme. With GPU acceleration, frames are processed at >30 frames per second, making the approach suitable for low-latency imaging, as required for obstacle avoidance.
研究动机与目标
- 解决紧凑SPAD阵列传感器获取的单光子LIDAR深度图中存在的横向分辨率低与噪声水平高的问题。
- 开发一种利用连续帧间时间相关性的视频超分辨率框架,以提升深度图质量。
- 在模拟真实世界噪声与分辨率限制的合成SPAD数据上训练深度学习模型。
- 实现实时、低延迟的深度图增强,适用于自主系统中的障碍物规避。
- 在合成与真实实验SPAD dToF数据上评估模型的鲁棒性。
提出的方法
- 使用集成Unreal Engine的AirSim模拟器生成合成深度序列,以模拟具有不同信噪比(SNR)的现实场景。
- 对合成数据进行处理,以模拟SPAD基深度测量特性,包括光子噪声与低SNR条件,从而构建多样化训练数据集。
- 训练3D CNN架构,从多个低分辨率输入帧重建高分辨率深度图,利用时空特征学习。
- 网络采用3D卷积,以利用连续帧之间的空间与时间相关性,提升特征表示能力。
- 训练过程仅使用合成数据,未使用真实数据,以实现对真实世界条件的泛化能力。
- 通过GPU加速推理,实现帧率超过30 FPS,适用于实时应用。
实验结果
研究问题
- RQ1基于深度学习的视频超分辨率方法能否有效提升单光子LIDAR深度图的分辨率并降低噪声?
- RQ2在低SNR条件下,所提方法与iSeeBetter等最先进方法相比性能如何?
- RQ3仅在合成数据上训练的模型在多大程度上能泛化到真实实验SPAD dToF传感器数据?
- RQ4为实现网络中有效的时间特征融合,保持物体间亚像素运动所需的帧率是多少?
- RQ5与单帧超分辨率相比,使用多帧输入是否能显著提升重建质量?
主要发现
- 在所有测试SNR水平下,包括最低SNR为0.25时,所提方法的PSNR与SSIM值均高于iSeeBetter基线方法。
- 网络对噪声具有强鲁棒性,在高噪声低SNR条件下仍能有效重建精细细节与平滑表面。
- 尽管仅在合成数据上训练,该模型在真实SPAD dToF传感器数据上仍生成视觉效果更优、时间上更一致的超分辨率输出。
- 该方法保持实时性能,在GPU上处理帧率超过30 FPS,适用于障碍物规避等低延迟应用。
- 与单帧超分辨率相比,使用多帧输入显著提升了特征重建与去噪效果,尤其在低帧率条件下优势明显。
- 消融实验表明,即使物体位移超过亚像素级别,网络性能依然稳定,表明其对动态场景具有强大泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。