Skip to main content
QUICK REVIEW

[论文解读] Scene Classification in Indoor Environments for Robots using Context Based Word Embeddings

Bao Xin Chen, Raghavender Sahdev|arXiv (Cornell University)|Aug 18, 2019
Advanced Image and Video Retrieval Techniques被引用 15
一句话总结

本文提出了一种面向室内机器人应用的上下文感知场景分类方法,通过结合基于CNN的场景识别与检测到的物体的词嵌入来优化预测结果。通过利用基于分类法的场景类别剪枝(基于GPS)以及在向量空间中通过物体-上下文相似性优化top-5 CNN预测,该方法在自建的真实世界数据集上实现了92.25%的top-1准确率,显著优于基线ResNet50模型。

ABSTRACT

Scene Classification has been addressed with numerous techniques in computer vision literature. However, with the increasing number of scene classes in datasets in the field, it has become difficult to achieve high accuracy in the context of robotics. In this paper, we implement an approach which combines traditional deep learning techniques with natural language processing methods to generate a word embedding based Scene Classification algorithm. We use the key idea that context (objects in the scene) of an image should be representative of the scene label meaning a group of objects could assist to predict the scene class. Objects present in the scene are represented by vectors and the images are re-classified based on the objects present in the scene to refine the initial classification by a Convolutional Neural Network (CNN). In our approach we address indoor Scene Classification task using a model trained with a reduced pre-processed version of the Places365 dataset and an empirical analysis is done on a real-world dataset that we built by capturing image sequences using a GoPro camera. We also report results obtained on a subset of the Places365 dataset using our approach and additionally show a deployment of our approach on a robot operating in a real-world environment.

研究动机与目标

  • 提升室内机器人环境中场景分类的准确性,因为在导航与任务执行中,高精度的场景识别至关重要。
  • 解决现有数据集(如Places365)存在的标注不一致与top-1准确率较低(约56%)的问题,使其难以在真实机器人部署中应用。
  • 通过使用分层分类法基于粗略GPS位置剪枝无关场景类别,降低计算复杂度并提升推理速度。
  • 通过学习的词嵌入捕捉物体与场景类别之间的语义关系,提升基于CNN的场景分类性能。
  • 通过新收集的高质量真实世界数据集验证该方法,并在实体机器人上实现实时部署。

提出的方法

  • 该方法采用双分支CNN架构:一个用于初始场景分类(top-5预测),另一个用于场景解析以检测前景与背景物体。
  • 通过在物体-场景共现数据上训练的word2vec风格模型,将检测到的物体嵌入连续向量空间,生成反映语义相似性的物体与场景向量。
  • 计算图像物体上下文的向量表示与top-5预测场景标签的向量表示之间的余弦相似度得分,以优化预测排序。
  • 通过将CNN置信度得分与词嵌入相似度得分相乘,重新排序预测结果,从而提升准确性。
  • 使用包含八个室内环境(如学校、家庭、购物中心)的分类法,基于GPS获取的粗略位置剪枝搜索空间,减少候选场景数量。
  • 系统部署于配备ZED相机与GTX 1060 GPU的Pioneer3AT机器人上,使用单目RGB图像实现端到端实时推理。

实验结果

研究问题

  • RQ1在室内机器人环境中,基于上下文的物体嵌入是否能超越标准CNN模型,提升场景分类准确率?
  • RQ2基于分类法的剪枝策略在减少候选场景类别数量与提升推理效率方面有多高效?
  • RQ3在物体-场景共现数据上训练的词嵌入模型,是否能有效通过捕捉语义上下文来优化CNN预测?
  • RQ4与基线CNN模型相比,该方法在标准数据集与真实世界数据集上的性能表现如何?
  • RQ5训练数据质量(如标注一致性)在多大程度上影响最终的分类准确率?

主要发现

  • 所提方法在作者自建的真实世界测试数据集上实现了92.25%的top-1准确率,显著优于基线ResNet50模型(同一数据集上为90.33%)。
  • 在缩减后的Places365验证集上,该方法实现了74.28%的top-1准确率,略高于ResNet50基线模型(73.82%)。
  • 与ResNet50基线相比,词嵌入优化步骤在自建数据集上将准确率提升了1.92%,证明了上下文物体信息的价值。
  • 该方法在家庭与学校环境中的表现尤为出色(top-1准确率分别为93.27%与92.25%),表明其在多样化室内场景中具有强鲁棒性。
  • 尽管整体性能有所提升,但在购物中心场景中优化效果较弱,原因在于场景解析模型对区分性物体(如鞋子、手表)的检测效果较差。
  • 在Pioneer3AT机器人上的真实世界部署验证了实时推理的可行性,系统成功在大学环境中对场景进行了准确分类。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。