Skip to main content
QUICK REVIEW

[论文解读] Deep Texture Manifold for Ground Terrain Recognition

Jia Xue, Hang Zhang|arXiv (Cornell University)|Mar 29, 2018
Advanced Image and Video Retrieval Techniques参考文献 32被引用 10
一句话总结

本文提出了一种深度编码池化网络(DEP),通过结合无序纹理特征与局部空间信息,实现了地面地形识别性能的提升,在GTOS和GTOS-mobile数据集上达到了最先进水平。此外,本文还引入了DEP-流形,一种参数化纹理流形,能够在二维空间中学习具有判别性的、类结构化的嵌入,从而实现对模糊类别边界的鲁棒表示,并具备分布外泛化能力。

ABSTRACT

We present a texture network called Deep Encoding Pooling Network (DEP) for the task of ground terrain recognition. Recognition of ground terrain is an important task in establishing robot or vehicular control parameters, as well as for localization within an outdoor environment. The architecture of DEP integrates orderless texture details and local spatial information and the performance of DEP surpasses state-of-the-art methods for this task. The GTOS database (comprised of over 30,000 images of 40 classes of ground terrain in outdoor scenes) enables supervised recognition. For evaluation under realistic conditions, we use test images that are not from the existing GTOS dataset, but are instead from hand-held mobile phone videos of similar terrain. This new evaluation dataset, GTOS-mobile, consists of 81 videos of 31 classes of ground terrain such as grass, gravel, asphalt and sand. The resultant network shows excellent performance not only for GTOS-mobile, but also for more general databases (MINC and DTD). Leveraging the discriminant features learned from this network, we build a new texture manifold called DEP-manifold. We learn a parametric distribution in feature space in a fully supervised manner, which gives the distance relationship among classes and provides a means to implicitly represent ambiguous class boundaries. The source code and database are publicly available.

研究动机与目标

  • 通过整合无序纹理与局部空间结构,提升机器人和自动驾驶车辆中的地面地形识别性能。
  • 解决真实世界地形数据集中类别边界模糊的问题,例如‘沥青’与‘石质沥青’或‘草地’与‘落叶’在视觉上极为相似。
  • 开发一种参数化纹理流形(DEP-流形),在二维空间中学习地形类别的连续、判别性嵌入,实现分布外样本的泛化能力。
  • 通过使用新采集的手机视频数据集(GTOS-mobile)在真实条件下评估识别性能,该数据集与训练数据不同。
  • 为未来在地形识别与纹理流形学习领域的研究,公开提供数据集与代码库。

提出的方法

  • DEP网络采用双分支特征提取:一个分支应用深度编码层以捕捉无序纹理外观,另一个分支使用全局平均池化以保留局部空间结构。
  • 通过双线性模型融合两个分支的特征,结合判别性纹理信息与空间信息。
  • DEP网络在GTOS数据集(30,000+张图像,40个类别)上端到端训练,使用交叉熵损失和标准CNN优化方法。
  • DEP-流形通过首先应用Barnes-Hut t-SNE学习DEP特征的非参数化二维嵌入,然后训练一个深度神经网络,以监督方式直接从DEP特征预测这些二维坐标。
  • 嵌入网络从零开始训练,使用L2损失,包含批量归一化和ReLU激活,优化时采用初始学习率衰减策略,训练80个周期。
  • 该方法支持分布外样本扩展,并生成平滑、类组织的二维流形,使相似材料在空间上彼此邻近。

实验结果

研究问题

  • RQ1能否通过联合建模无序纹理与局部空间结构的深度学习模型,在地面地形识别任务中超越现有方法?
  • RQ2如何学习一种参数化纹理流形,以表征地形类别的内在结构,特别是在模糊边界区域?
  • RQ3所提出的DEP网络是否能在训练过程中未见的真实世界手持移动视频数据上实现良好泛化?
  • RQ4DEP-流形能否提供一种有意义、连续且具有判别性的地形材料嵌入,准确反映其视觉相似性?
  • RQ5该系统在分布外但属于域内(in-domain)的地形数据集(如MINC和DTD)上的性能如何?

主要发现

  • DEP网络在GTOS数据集上达到最先进性能,并在MINC和DTD数据集上展现出强大的迁移能力。
  • 在新采集的GTOS-mobile数据集(81段视频,31个地形类别,由手机拍摄)上,DEP在真实、光照与视角多变的条件下表现出稳健性能。
  • 与DEP-参数化t-SNE相比,DEP-流形生成的二维嵌入更加均匀且类组织性更强,减少了拥挤与稀疏现象。
  • 在DEP-流形可视化中,误分类图像通常被投影到正确类别的附近,表明流形捕捉到了有意义的视觉相似性。
  • DEP识别的混淆矩阵中非对角线元素极少,且存在的元素通常靠近对角线,表明误分类主要发生在语义上相近的地形类别之间。
  • 在NVIDIA Titan X上,从零开始训练DEP-流形耗时不足5分钟,体现了计算效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。