[论文解读] Convolutional neural network-based regression for depth prediction in digital holography
该论文提出了一种基于卷积神经网络(CNN)的回归模型,用于在数字全息中直接、高精度地预测深度,避免了耗时的迭代深度搜索。通过使用全息图的功率谱作为输入,该方法实现了毫米级精度(平均误差7.2 mm),并将每张全息图的预测时间从2.9秒减少至3.5毫秒,显著加速了重建工作流程。
Digital holography enables us to reconstruct objects in three-dimensional space from holograms captured by an imaging device. For the reconstruction, we need to know the depth position of the recoded object in advance. In this study, we propose depth prediction using convolutional neural network (CNN)-based regression. In the previous researches, the depth of an object was estimated through reconstructed images at different depth positions from a hologram using a certain metric that indicates the most focused depth position; however, such a depth search is time-consuming. The CNN of the proposed method can directly predict the depth position with millimeter precision from holograms.
研究动机与目标
- 消除数字全息中计算成本高且耗时的迭代深度搜索需求。
- 利用深度学习实现在全息图上直接、实时的深度预测。
- 通过将深度建模为连续回归问题而非离散分类问题,提升深度估计精度。
- 评估使用原始全息图和其功率谱作为输入特征时,CNN回归的性能表现。
- 证明利用功率谱可简化网络结构,同时保持高预测精度的可行性。
提出的方法
- 训练一个包含四个卷积层、ReLU激活函数、最大池化层以及两个全连接层的深度CNN,用于预测连续的深度值。
- 网络使用均方误差(MSE)损失函数,以在训练过程中最小化预测深度与真实深度之间的差异。
- 输入数据包括原始全息图及其功率谱,尺寸从1024×1024像素降低至128×128像素以提升计算效率。
- 输出层采用线性(恒等)激活函数,以生成连续的深度预测结果。
- 训练使用Adam优化器,初始学习率为0.0005,并在损失停滞时进行调整。
- 该方法在基线深度搜索对比中,利用角谱法进行衍射计算。
实验结果
研究问题
- RQ1基于CNN的回归模型能否在无需迭代深度搜索的情况下,实现数字全息中毫米级精度的深度预测?
- RQ2与使用原始全息图相比,使用全息图的功率谱在预测精度和模型复杂度方面表现如何?
- RQ3所提出的CNN与使用聚焦度量的传统深度搜索相比,其推理速度如何?
- RQ4该CNN能否在不同物体深度和全息配置下保持高精度的泛化能力?
- RQ5当使用功率谱时,将全息图尺寸减小至128×128像素是否会损害深度预测性能?
主要发现
- 使用功率谱作为输入的CNN模型实现了7.2 mm的平均深度误差,对应验证损失为5.245×10⁻⁵。
- 仅使用原始全息图的模型平均误差高达50 mm,验证损失为0.00249。
- 所提出的CNN将深度预测时间从2,892 ms(深度搜索)降低至每张全息图仅3.5 ms(GPU上)。
- 基于Tamura系数的深度搜索确定聚焦平面为0.147 m,而CNN预测值为0.138 m,误差为5 mm。
- 功率谱输入使网络结构更简单,且性能显著优于原始全息图输入。
- 该方法在数字全息中实现实时深度预测具有可行性,尤其在使用降采样功率谱时表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。