Skip to main content
QUICK REVIEW

[论文解读] Deep Dual Pyramid Network for Barcode Segmentation using Barcode-30k Database

Qijie Zhao, Feng Ni|arXiv (Cornell University)|Jul 31, 2018
Vehicle License Plate Recognition参考文献 24被引用 3
一句话总结

本文提出 Barcode-30k,一个包含 30,000 幅条形码和二维码图像的大规模合成数据集,附带像素级标注,并引入 BarcodeNet,一种基于先验金字塔池化(P3M)和金字塔精炼模块(PRM)的深度双金字塔分割网络,以提升边界精度和语义理解能力。该模型在验证集上达到 95.36% 的 mIoU,且在真实世界图像上具有良好的泛化能力。

ABSTRACT

Digital signs(such as barcode or QR code) are widely used in our daily life, and for many applications, we need to localize them on images. However, difficult cases such as targets with small scales, half-occlusion, shape deformation and large illumination changes cause challenges for conventional methods. In this paper, we address this problem by producing a large-scale dataset and adopting a deep learning based semantic segmentation approach. Specifically, a synthesizing method was proposed to generate well-annotated images containing barcode and QR code labels, which contributes to largely decrease the annotation time. Through the synthesis strategy, we introduce a dataset that contains 30000 images with Barcode and QR code - Barcode-30k. Moreover, we further propose a dual pyramid structure based segmentation network - BarcodeNet, which is mainly formed with two novel modules, Prior Pyramid Pooling Module(P3M) and Pyramid Refine Module(PRM). We validate the effectiveness of BarcodeNet on the proposed synthetic dataset, and it yields the result of mIoU accuracy 95.36\% on validation set. Additional segmentation results of real images have shown that accurate segmentation performance is achieved.

研究动机与目标

  • 为解决在真实世界条件下(如小尺度、遮挡和光照变化)条形码与二维码分割任务中缺乏大规模、高质量标注数据集的问题。
  • 开发一种基于深度学习的语义分割模型,专门针对具有规则形状和结构纹理的数字标识,而现有模型在处理此类目标时表现不佳。
  • 通过一种新颖的图像合成策略,生成具有精确像素级标签的真实感条形码与二维码图像,从而降低标注成本。
  • 通过双金字塔架构整合全局语义上下文与浅层结构特征,提升分割边界精度。

提出的方法

  • 通过在多样化背景图像上叠加真实的条形码/二维码模板,并控制尺度、旋转、裁剪和光照等变化,构建数据合成流水线,生成 30,000 幅逼真的条形码与二维码图像。
  • 先验金字塔池化模块(P3M)通过引入全局先验信息来引导局部位置分布,增强特征学习,尤其有利于大目标的识别。
  • 金字塔精炼模块(PRM)通过聚合和精炼来自早期卷积层的浅层特征,提升边界分割精度。
  • BarcodeNet 基于类似 PSPNet 的主干网络,但通过引入 P3M 和 PRM 模块,联合捕捉高层语义信息与低层结构细节。
  • 网络在合成的 Barcode-30k 数据集上端到端训练,采用交叉熵损失与 Dice 损失联合优化,并通过数据增强提升鲁棒性。
  • 通过在办公室环境中收集的真实世界图像评估模型泛化能力,结果表明其具备出色的零样本迁移性能。

实验结果

研究问题

  • RQ1一个具有精确像素级标注的大规模合成数据集,是否能显著降低标注成本,同时保持在真实世界场景下的泛化能力,用于条形码分割?
  • RQ2深度学习模型如何有效利用全局语义上下文与局部结构特征,以提升对规则形状数字标识的分割性能?
  • RQ3通过专用精炼模块整合浅层特征,在多大程度上能提升条形码与二维码分割的边界精度?
  • RQ4双金字塔架构——结合全局先验引导与多尺度特征精炼——是否在该特定任务上优于标准语义分割网络?

主要发现

  • BarcodeNet 在 Barcode-30k 验证集上达到 95.36% 的平均交并比(mIoU),显著优于 FCN-8s 和标准 PSPNet 等基线模型。
  • 采用两层卷积层对来自 Res1(最浅层)的特征进行精炼的金字塔精炼模块(PRM)表现最佳,mIoU 达到 91.63%,证明了浅层特征融合的重要性。
  • 可视化对比显示,BarcodeNet 能有效分割小尺寸、重叠及部分遮挡的条形码,同时减少基线模型中常见的边界模糊与漏检问题。
  • 在真实世界图像上,经过合成 Barcode-30k 数据集预训练的 BarcodeNet 仍能产生高度准确的分割结果,即使在截断和小目标尺度等挑战性条件下亦表现优异。
  • 该合成策略可高效生成多样化、逼真的训练数据,且人工标注成本极低,适用于时间敏感的分割任务。
  • 该方法与模型可推广至其他规则形状目标,如标志、交通标志和广告牌,表明其在条形码与二维码之外具有更广泛的应用潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。