[论文解读] Indoor Depth Completion with Boundary Consistency and Self-Attention
本文提出了一种新颖的端到端深度补全网络,通过整合自注意力机制与边界一致性,显著提升了室内场景下深度图的质量。通过利用自注意力机制捕捉长距离依赖关系,并借助辅助网络强制实施边界一致性,该方法在Matterport3D数据集上实现了最先进性能,显著减少了模糊现象,并增强了补全后深度图的结构保真度。
Depth estimation features are helpful for 3D recognition. Commodity-grade depth cameras are able to capture depth and color image in real-time. However, glossy, transparent or distant surface cannot be scanned properly by the sensor. As a result, enhancement and restoration from sensing depth is an important task. Depth completion aims at filling the holes that sensors fail to detect, which is still a complex task for machine to learn. Traditional hand-tuned methods have reached their limits, while neural network based methods tend to copy and interpolate the output from surrounding depth values. This leads to blurred boundaries, and structures of the depth map are lost. Consequently, our main work is to design an end-to-end network improving completion depth maps while maintaining edge clarity. We utilize self-attention mechanism, previously used in image inpainting fields, to extract more useful information in each layer of convolution so that the complete depth map is enhanced. In addition, we propose boundary consistency concept to enhance the depth map quality and structure. Experimental results validate the effectiveness of our self-attention and boundary consistency schema, which outperforms previous state-of-the-art depth completion work on Matterport3D dataset. Our code is publicly available at https://github.com/tsunghan-wu/Depth-Completion.
研究动机与目标
- 解决基于神经网络的深度补全中边界模糊与结构保真度差的问题。
- 克服基于插值的方法因复制或涂抹邻近像素深度值而带来的局限性。
- 提升在因传感器限制(如镜面、透明或远距离表面)导致大范围缺失区域场景下的深度补全鲁棒性。
- 开发一种端到端可训练的框架,以增强深度预测中的几何理解与语义感知能力。
- 提出边界一致性作为新型正则化策略,以保留清晰的物体边界并提升结构的真实性。
提出的方法
- 在编码器-解码器架构中集成自注意力机制,使特征图能够动态关注输入中语义与几何上相关的区域。
- 利用表面法向量与遮挡边界作为辅助监督信号,以引导注意力机制并提升深度估计精度。
- 训练一个独立的边界预测头,从预测的深度图中生成遮挡边界,随后用于监督主深度补全网络。
- 应用边界一致性损失,惩罚预测边界与真实边缘之间的偏差,从而促进更清晰、更真实的深度结构。
- 结合多尺度监督,使用SSIM与RMSE损失以增强感知质量与回归精度。
- 使用复合损失函数(包含RMSE、SSIM与边界一致性损失)端到端训练整个模型。
实验结果
研究问题
- RQ1自注意力机制是否能通过使模型聚焦于语义与几何上相关的区域,而非依赖局部插值,从而改善深度补全?
- RQ2通过辅助网络强制实施边界一致性,是否能相比标准监督带来更清晰、更准确的深度边界?
- RQ3与先前最先进方法相比,自注意力与边界一致性相结合在Matterport3D等基准数据集上的性能提升程度如何?
- RQ4在存在大范围缺失区域(如反射或透明表面导致)的挑战性情况下,该方法如何应对?
- RQ5该模型能否在具有复杂几何结构与不同光照条件的真实室内场景中保持结构保真度的同时实现良好泛化?
主要发现
- 所提方法在Matterport3D数据集上测试的RMSE达到1.092,优于先前最先进方法。
- 引入边界一致性后,模型在10%误差范围内的预测比例达到75.8%(δ1.10),较基线显著提升。
- 自注意力与边界一致性的引入使SSIM从无自注意力时的0.605提升至0.799,表明在结构相似性与边缘清晰度方面有显著增益。
- 消融实验表明,边界一致性对结构质量贡献最大,SSIM提升3%,且边缘检测清晰度有显著改善。
- 注意力图可视化显示,网络学会了关注物体边界与缺失区域,证明其在深度补全中实现了有效的特征选择。
- 与非端到端优化方法相比,该模型实现了更快的训练速度与实时推理,适用于机器人及AR/VR应用的实用部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。