[论文解读] Estimated Depth Map Helps Image Classification
本文提出将通过预训练深度估计网络生成的估计深度图作为额外输入特征,以提升RGB图像的图像分类性能。通过在CIFAR-10数据集上构建RGBD数据集并同时使用RGB和RGBD输入进行训练,作者证明了深度图能提供更优的特征表示,使ResNet-20的准确率提升0.55%,ResNet-56的准确率提升0.53%,表明在浅层和深层网络中均实现了稳定的性能增益。
We consider image classification with estimated depth. This problem falls into the domain of transfer learning, since we are using a model trained on a set of depth images to generate depth maps (additional features) for use in another classification problem using another disjoint set of images. It's challenging as no direct depth information is provided. Though depth estimation has been well studied, none have attempted to aid image classification with estimated depth. Therefore, we present a way of transferring domain knowledge on depth estimation to a separate image classification task over a disjoint set of train, and test data. We build a RGBD dataset based on RGB dataset and do image classification on it. Then evaluation the performance of neural networks on the RGBD dataset compared to the RGB dataset. From our experiments, the benefit is significant with shallow and deep networks. It improves ResNet-20 by 0.55% and ResNet-56 by 0.53%. Our code and dataset are available publicly.
研究动机与目标
- 探究将估计深度图作为额外输入特征是否能提升图像分类性能。
- 弥合深度估计与图像分类之间的差距,这一领域此前尚未应用深度图。
- 评估深度特征在浅层和深层神经网络中的有效性。
- 利用预训练深度估计模型生成的估计深度图,创建一个公开可用的CIFAR-10 RGBD数据集。
- 提出一种基于迁移学习的新度量方法,根据下游分类性能评估深度估计质量。
提出的方法
- 通过将CIFAR-10图像缩放至400×400,使用预训练的深度卷积神经场模型估计深度,并将深度图下采样至32×32,构建RGBD数据集。
- 将原始RGB通道与估计的深度图结合,形成4通道输入张量(32×32×4)用于RGBD训练。
- 在单个R、G、B和D通道上分别训练两层前馈神经网络,以比较特征表示质量。
- 在RGB和RGBD数据集上分别训练并比较标准ResNet-20和ResNet-56模型,以评估深层网络中的性能增益。
- 提出一种基于下游图像分类准确率提升的深度估计质量新评估度量。
- 使用TensorFlow进行深度估计,使用Caffe训练分类网络。
实验结果
研究问题
- RQ1单目深度估计模型生成的估计深度图作为额外输入特征,是否能提升图像分类性能?
- RQ2在图像分类任务中,深度通道的特征表示是否优于RGB通道?
- RQ3在浅层和深层神经网络架构中,添加深度图带来的性能增益是否依然存在?
- RQ4在缺乏真实深度标签的情况下,能否基于分类准确率使用一种基于迁移学习的度量来评估深度估计质量?
- RQ5深度图带来的性能提升是否源于RGB特征无法捕捉的新颖互补信息?
主要发现
- 当作为两层前馈网络的输入时,仅使用深度通道的验证准确率高于R、G或B通道,表明其具有更优的特征表示能力。
- 使用两层网络时,基于RGBD数据集的训练相比仅使用RGB的训练,分类性能提升了4%,证明了深度作为辅助输入的价值。
- 与RGB数据集相比,ResNet-20在RGBD数据集上训练时,top-1错误率降低了0.55%。
- ResNet-56在RGBD数据集上的错误率为6.44%,优于在RGB数据集上的6.97%,绝对提升0.53%。
- RGBD模型的收敛速度优于RGB模型,表明深度图提供了更具判别性或结构化的特征,有助于优化过程。
- 深层网络中的性能增益表明,深度特征包含了端到端学习RGB图像时未完全捕捉的信息。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。