Skip to main content
QUICK REVIEW

[论文解读] One-shot Texture Segmentation

Ivan Ustyuzhaninov, Claudio Michaelis|arXiv (Cornell University)|Jul 7, 2018
Generative Adversarial Networks and Image Synthesis参考文献 36被引用 11
一句话总结

本文提出了一种一次样本纹理分割(one-shot texture segmentation)任务,作为自监督基准,模型仅通过一个参考图像块即可分割图像中的纹理。该方法利用自然纹理生成的合成数据训练深度学习模型,使其无需微调即可泛化到真实图像和视频,在自然图像分割与物体分类任务中实现优异的零样本性能。

ABSTRACT

We introduce one-shot texture segmentation: the task of segmenting an input image containing multiple textures given a patch of a reference texture. This task is designed to turn the problem of texture-based perceptual grouping into an objective benchmark. We show that it is straight-forward to generate large synthetic data sets for this task from a relatively small number of natural textures. In particular, this task can be cast as a self-supervised problem thereby alleviating the need for massive amounts of manually annotated data necessary for traditional segmentation tasks. In this paper we introduce and study two concrete data sets: a dense collage of textures (CollTex) and a cluttered texturized Omniglot data set. We show that a baseline model trained on these synthesized data is able to generalize to natural images and videos without further fine-tuning, suggesting that the learned image representations are useful for higher-level vision tasks.

研究动机与目标

  • 将基于纹理的感知分组形式化为自监督学习基准。
  • 开发一种可扩展、数据高效的纹理分割模型训练方法,无需人工标注。
  • 评估在合成纹理数据上学习的表征是否能泛化到真实世界自然图像与视频。
  • 探究高阶局部图像统计量在鲁棒纹理表征学习中的作用。
  • 展示纹理表征在下游任务(如视频物体分割与图像分类)中的零样本迁移能力。

提出的方法

  • 任务定义为:仅使用该纹理的一个参考图像块,在复杂图像中分割出该纹理。
  • 构建两个合成数据集:CollTex(自然纹理的密集拼贴)和texturized Omniglot(带有纹理叠加的杂乱字符)。
  • 使用编码器-解码器架构并带有跳跃连接的深度神经网络,在这些合成数据集上以自监督方式训练。
  • 通过预训练的VGG网络提取深层特征,实现对纹理统计量的参数化建模。
  • 通过学习的相似性度量,比较输入图像与参考图像块之间的局部图像统计量,完成分割。
  • 通过在真实图像上应用多个参考图像块并使用逻辑掩码合并预测结果,实现向自然图像的泛化。

实验结果

研究问题

  • RQ1在合成纹理数据上进行自监督学习,能否产生可泛化到真实世界视觉任务的中级表征?
  • RQ2高阶局部图像统计量在一次样本分割中的纹理鲁棒区分中起到何种作用?
  • RQ3在未微调的情况下,基于合成纹理拼贴训练的模型在自然图像与视频分割任务中的泛化程度如何?
  • RQ4通过自监督方式学习的基于纹理的表征能否用于自然图像中零样本物体分类?
  • RQ5最具信息量的纹理图像块在视觉与定量上如何比较其预测能力?

主要发现

  • 仅使用合成的CollTex训练数据且无需微调,该模型在DAVIS 2016视频物体分割基准上达到84.8%的IoU。
  • 在仅使用纹理线索的ImageNet豹类分类任务中,模型准确率达到85%,优于基于像素的线性模型(约70%)。
  • 最具信息量的纹理图像块在视觉上相似,而信息量最少的图像块则表现出明显的颜色差异,表明视觉一致性与预测能力相关。
  • 该模型能有效泛化到自然图像与视频,表明自监督纹理学习可产生有用的中级表征。
  • 该任务需要建模高阶局部图像统计量,表明仅使用低级特征不足以实现鲁棒分割。
  • 通过多个纹理图像块的预测结果融合,可提升自然视频中的分割准确率,证实该方法对部分或模糊线索具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。