QUICK REVIEW
[论文解读] Single image depth estimation by dilated deep residual convolutional neural network and soft-weight-sum inference
Bo Li, Yuchao Dai|arXiv (Cornell University)|Apr 27, 2017
Advanced Vision and Imaging参考文献 7被引用 19
一句话总结
该论文提出一种空洞深度残差CNN与软加权求和推理方法,用于单幅图像深度估计,在NYU Depth V2数据集上实现了最先进性能,且训练样本和模型参数显著减少。该方法利用空洞卷积实现大感受野,通过跳跃连接实现多尺度特征融合,并采用可微分的软加权求和推理,生成平滑且边界保持的深度图。
ABSTRACT
This paper proposes a new residual convolutional neural network (CNN) architecture for single image depth estimation. Compared with existing deep CNN based methods, our method achieves much better results with fewer training examples and model parameters. The advantages of our method come from the usage of dilated convolution, skip connection architecture and soft-weight-sum inference. Experimental evaluation on the NYU Depth V2 dataset shows that our method outperforms other state-of-the-art methods by a margin.
研究动机与目标
- 通过改进深度CNN架构设计,解决单幅图像深度估计的病态性问题。
- 在保持或提升性能的同时,降低模型复杂度和训练数据需求。
- 通过更优的特征融合与边界保持,提升深度图质量。
- 开发一种可微分的推理方法,相较于硬阈值法,提升深度估计精度。
提出的方法
- 通过移除全连接层,将152层残差网络进行改造,使参数减少超过80%。
- 采用空洞卷积在不增加参数量或降低空间分辨率的前提下扩展感受野。
- 引入跳跃连接,将高层与中间层特征图拼接,实现多尺度特征融合与边界保持。
- 通过在对数空间中将深度离散化为200个bin,将深度估计重构为分类任务。
- 使用多项式逻辑损失与softmax进行训练,每个像素输出一个得分分布。
- 采用软加权求和推理:深度估计 $ d_i = \exp(\mathbf{w}^T \mathbf{p}_i) $,其中 $ \mathbf{p}_i $ 为预测得分向量,$ \mathbf{w} $ 为bin权重向量,实现从离散得分到连续深度预测的映射。
实验结果
研究问题
- RQ1是否可通过减少参数和训练数据的空洞残差CNN架构,实现更优的深度估计性能?
- RQ2特征图之间的跳跃连接在多尺度特征融合与边界保持方面有何影响?
- RQ3软加权求和推理是否在从离散得分分布进行深度回归时优于硬阈值法?
- RQ4空洞卷积、跳跃连接与软加权求和推理对最终性能的独立贡献程度如何?
主要发现
- 所提方法在NYU Depth V2数据集上,$ \delta < 1.25 $ 准确率达83.5%,$ \delta < 1.25^2 $ 达96.7%,$ \delta < 1.25^3 $ 达99.1%,全面超越所有最先进方法。
- 相对误差(Rel)为0.125,log10误差为0.052,RMS误差为0.519,显著低于先前工作。
- 仅使用12,000张训练图像与6000万参数,性能即超越使用240,000张图像与最高达3.5亿参数的方法。
- 消融实验表明,空洞卷积、跳跃连接与软加权求和推理三者均对性能提升有贡献。
- 定性结果表明,软加权求和推理生成的深度图更平滑,边界更清晰,优于硬阈值法。
- 随着bin数增加(如1000个bin),像素级准确率显著下降(如下降7%),表明收益递减,从而证明软加权求和在最优深度回归中的合理性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。