[论文解读] A Novel Monocular Disparity Estimation Network with Domain Transformation and Ambiguity Learning
该论文提出了一种新颖的无监督单目视差估计网络 rrdispnet_dtm,通过整合全分辨率跳跃连接、矩形卷积、编码器与解码器特征之间的领域转换模块以及模糊性掩码估计,显著提升了准确率与效率。该方法在 KITTI2015 上实现了最先进性能,所有指标均优于 Monodepth,且仅需一次前向传播即可生成完整视差图,参数量更少。
Convolutional neural networks (CNN) have shown state-of-the-art results for low-level computer vision problems such as stereo and monocular disparity estimations, but still, have much room to further improve their performance in terms of accuracy, numbers of parameters, etc. Recent works have uncovered the advantages of using an unsupervised scheme to train CNN's to estimate monocular disparity, where only the relatively-easy-to-obtain stereo images are needed for training. We propose a novel encoder-decoder architecture that outperforms previous unsupervised monocular depth estimation networks by (i) taking into account ambiguities, (ii) efficient fusion between encoder and decoder features with rectangular convolutions and (iii) domain transformations between encoder and decoder. Our architecture outperforms the Monodepth baseline in all metrics, even with a considerable reduction of parameters. Furthermore, our architecture is capable of estimating a full disparity map in a single forward pass, whereas the baseline needs two passes. We perform extensive experiments to verify the effectiveness of our method on the KITTI dataset.
研究动机与目标
- 为解决无监督单目视差估计的局限性,特别是深度估计中的模糊性与特征融合低效问题。
- 通过在编码器与解码器之间引入全分辨率特征与领域转换,提升性能,超越 Monodepth 基线。
- 实现端到端、单次前向传播的视差图预测,无需多次前向传播或真实标签监督。
- 通过模糊性掩码估计与改进的特征融合,增强对细长结构与侧向伪影的鲁棒性。
- 通过自建手机拍摄数据集,在真实世界、非 KITTI 数据集上验证方法的泛化能力。
提出的方法
- 网络采用编码器-解码器架构,结合残差块与全分辨率跳跃连接,以保留空间细节。
- 引入 3x5 的矩形卷积,高效融合编码器与解码器之间的特征,提升空间对齐效果。
- 在编码器与解码器特征之间应用领域转换模块,将特征从“左视图域”映射至“左-右视图域”,实现更有效的跨域特征融合。
- 与视差图同步预测模糊性掩码,用于识别不确定性区域,如遮挡区域或无纹理区域。
- 采用多组件损失函数进行训练:光度重建损失、视差平滑损失与一致性损失,所有损失均以无监督方式优化。
- 训练使用无真实视差标签的立体图像对,利用视图合成来监督深度估计。
实验结果
研究问题
- RQ1编码器与解码器特征之间的领域转换是否能提升无监督单目深度学习中的视差估计准确率?
- RQ2模糊性掩码预测如何影响遮挡或无纹理区域中视差估计的鲁棒性?
- RQ3单次前向传播能否生成完整视差图,且性能优于需两次前向传播的模型?
- RQ4矩形卷积与全分辨率特征的集成是否能在提升性能的同时减少网络参数?
- RQ5与现有无监督基线相比,该方法在真实世界、非实验室数据集上的泛化能力如何?
主要发现
- rrdispnet_dtm 模型在 KITTI2015 基准测试中实现了最低的 RMSE,所有指标均优于 Monodepth pp 基线。
- 该模型仅需一次前向传播即可生成完整视差图,而 Monodepth pp 需要两次前向传播(输入翻转后)。
- rrdispnet_dtm 在细长结构检测方面表现出更优的清晰度与准确性,且侧向伪影更少。
- 该模型在 warp RMSE 上达到最低值,表明从左视图合成右视图的保真度更高,证实了视差质量更优。
- 在自建手机拍摄数据集中,rrdispnet_dtm 生成的视差图更合理,细节保留更完整,远场深度估计性能优于 Monodepth pp。
- 采用领域转换与矩形卷积的模型(rrdispnet_dtm)参数量少于 Monodepth,同时性能更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。