Skip to main content
QUICK REVIEW

[论文解读] Semantic Segmentation from Limited Training Data

Anton Milan, Trung Pham|arXiv (Cornell University)|Sep 22, 2017
Advanced Neural Network Applications参考文献 35被引用 5
一句话总结

本文提出两种用于在杂乱、非结构化环境中进行机器人感知的语义分割方法,仅需极少的训练数据——深度度量学习(DML)和微调后的ReFineNet。DML方法采用基于图像块的嵌入和投票机制,实现零样本适应;而ReFineNet仅需每种新物体7张图像即可实现高精度分割,从而在亚马逊机器人挑战赛2017中实现快速部署。

ABSTRACT

We present our approach for robotic perception in cluttered scenes that led to winning the recent Amazon Robotics Challenge (ARC) 2017. Next to small objects with shiny and transparent surfaces, the biggest challenge of the 2017 competition was the introduction of unseen categories. In contrast to traditional approaches which require large collections of annotated data and many hours of training, the task here was to obtain a robust perception pipeline with only few minutes of data acquisition and training time. To that end, we present two strategies that we explored. One is a deep metric learning approach that works in three separate steps: semantic-agnostic boundary detection, patch classification and pixel-wise voting. The other is a fully-supervised semantic segmentation approach with efficient dataset collection. We conduct an extensive analysis of the two methods on our ARC 2017 dataset. Interestingly, only few examples of each class are sufficient to fine-tune even very deep convolutional neural networks for this specific task.

研究动机与目标

  • 开发一种在杂乱、非结构化仓库环境中,仅使用有限训练数据的鲁棒机器人目标抓取感知系统。
  • 解决在比赛开始前仅45分钟才提供未见过物体类别所带来的挑战。
  • 通过仅数分钟的数据采集与训练,实现在深度神经网络上的快速适应。
  • 对比零样本深度度量学习与少样本监督微调在真实机器人感知任务中的性能表现。

提出的方法

  • 提出一个三阶段深度度量学习(DML)流程:类别无关的边界检测、基于学习特征嵌入的图像块分类,以及最终分割的像素级投票。
  • 采用度量学习框架,将同一物体的图像块映射到低维特征空间中相近的位置,从而实现最近邻分类。
  • 使用RGB-D输入进行初始分割,HHA特征用于边界检测,并通过深度图像修复提升鲁棒性。
  • 应用ReFineNet——一种深度全卷积神经网络,用于端到端语义分割,仅用每种新物体7张图像进行微调。
  • 实施高效的采集策略:每种物体采集7个视角,并使用半自动分割生成像素级掩码。
  • 采用F0.5分数(加权F1)作为主要评估指标,优先考虑召回率以更准确反映机器人操作中的抓取成功率。

实验结果

研究问题

  • RQ1深度度量学习是否能在引入新物体类别时无需任何微调,仍能实现鲁棒的语义分割?
  • RQ2对深度神经网络(如ReFineNet)进行少样本微调,在极少量训练数据下对机器人感知中的语义分割效果如何?
  • RQ3每类新物体的最优训练图像数量是多少,才能在时间效率与分割精度之间取得最佳平衡?
  • RQ4在真实场景中,场景杂乱程度(物体数量)如何影响少样本语义分割模型的性能?
  • RQ5每类训练样本数量与分割性能的相关性有多大?还是外观特征才是主导因素?

主要发现

  • DML方法在1分钟推理时间内实现了0.59的F0.5分数,但性能受限于基于COB的分割噪声;若使用完美分割,F0.5分数可提升至0.85。
  • 完全监督的ReFineNet方法在每类仅7张图像的情况下,实现了0.62的F0.5分数,优于DML,因此被选为最终比赛系统的实现方案。
  • 性能与每类训练样本数量无明显相关性——外观特征与视觉可区分性比数据量更具影响力。
  • F0.5指标比F1更能反映抓取能力,因其对低召回率的惩罚更重,更符合机器人操作的目标。
  • 随着场景中物体数量的增加,性能单调下降:当每场景物体数从1增加到20时,F0.5分数从约0.85降至约0.45。
  • 每类物体提供7张图像时,在数据采集时间与性能之间达到最佳平衡,超过12张图像后收益递减。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。