Skip to main content
QUICK REVIEW

[论文解读] Unbiasing Semantic Segmentation For Robot Perception using Synthetic Data Feature Transfer

Jonathan Balloch, Varun Agrawal|arXiv (Cornell University)|Sep 11, 2018
Advanced Neural Network Applications参考文献 40被引用 12
一句话总结

本文提出使用合成分割数据对实时语义分割模型进行预训练,以提升机器人感知性能,显著优于ImageNet预训练。通过从多样化、低偏差的合成数据中迁移特征,模型在较少的真实世界微调数据下实现更高精度,尤其在真实数据稀缺时表现更优。

ABSTRACT

Robot perception systems need to perform reliable image segmentation in real-time on noisy, raw perception data. State-of-the-art segmentation approaches use large CNN models and carefully constructed datasets; however, these models focus on accuracy at the cost of real-time inference. Furthermore, the standard semantic segmentation datasets are not large enough for training CNNs without augmentation and are not representative of noisy, uncurated robot perception data. We propose improving the performance of real-time segmentation frameworks on robot perception data by transferring features learned from synthetic segmentation data. We show that pretraining real-time segmentation architectures with synthetic segmentation data instead of ImageNet improves fine-tuning performance by reducing the bias learned in pretraining and closing the extit{transfer gap} as a result. Our experiments show that our real-time robot perception models pretrained on synthetic data outperform those pretrained on ImageNet for every scale of fine-tuning data examined. Moreover, the degree to which synthetic pretraining outperforms ImageNet pretraining increases as the availability of robot data decreases, making our approach attractive for robotics domains where dataset collection is hard and/or expensive.

研究动机与目标

  • 解决在有限且嘈杂的真实世界数据下训练实时语义分割模型用于机器人感知的挑战。
  • 克服在低资源机器人视觉场景中,ImageNet预训练引入的偏差和分布偏移问题。
  • 探究合成数据预训练是否能比ImageNet预训练更有效地弥合合成数据与真实机器人感知数据之间的领域差距。
  • 量化在不同数量的真实世界微调数据下,合成预训练带来的性能提升。
  • 评估高层领域相似性与数据多样性、规模及偏差在合成预训练有效性中的作用。

提出的方法

  • 在大规模合成RGB-D分割数据集(如SceneNet RGB-D、GTA)上预训练实时分割架构(如DeepLabv3+与MobileNet),而非在ImageNet上进行预训练。
  • 使用逐步缩小的标记数据子集,在真实机器人感知数据集(如Cityscapes、SUN RGB-D、Robot@Home)上微调预训练模型。
  • 以平均交并比(mIoU)为主要指标,与在ImageNet上预训练的模型进行性能对比。
  • 通过消融研究分离高层领域相似性的影响,比较在相似与不相似的合成数据集上预训练的效果(如使用GTA用于驾驶场景,SceneNet用于室内导航)。
  • 利用迁移学习评估合成预训练如何减小合成数据与真实数据之间的领域偏移差距(G^{tr})。
  • 通过比较在不同合成数据分布上训练的模型,分析合成预训练中数据多样性、规模与领域相似性之间的权衡。

实验结果

研究问题

  • RQ1与ImageNet预训练相比,使用合成数据预训练实时分割模型是否能提升在真实机器人感知数据上的微调性能?
  • RQ2随着真实世界微调数据量的减少,合成预训练带来的性能增益如何变化?
  • RQ3合成预训练数据与真实目标数据之间的高层领域相似性在多大程度上影响模型性能?
  • RQ4合成预训练的优势是源于领域相似性,还是其他因素(如数据多样性、规模和偏差降低)?
  • RQ5合成预训练能否减少机器人应用中实现强分割性能所需的真实世界数据量?

主要发现

  • 在所有微调数据规模下,使用合成数据预训练的模型均优于ImageNet预训练模型,且随着真实数据减少,性能增益进一步提升。
  • 与ImageNet预训练相比,合成预训练可将真实世界数据需求减少15%至50%,使模型在显著更少的标注数据下达到ImageNet基线性能。
  • 即使仅使用25K帧,基于SceneNet RGB-D或GTA的合成预训练在Cityscapes和SUN RGB-D上均优于ImageNet预训练,证明了合成数据的有效性,即使其规模较小。
  • 在输入多样性高且偏差低的合成数据上预训练的模型,其性能优于在相似高层领域但代表性较差的合成数据上预训练的模型。
  • 预训练数据与目标数据之间的高层相似性虽带来一定性能优势,但数据多样性与偏差降低才是比领域相似性本身更强的性能预测因子。
  • 随着真实世界数据可用性的下降,ImageNet与合成预训练之间的性能差距持续扩大,证实合成预训练是数据稀缺机器人应用的可扩展解决方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。