Skip to main content
QUICK REVIEW

[论文解读] Towards an Efficient Semantic Segmentation Method of ID Cards for Verification Systems

Rodrigo Lara, Andrés Valenzuela|arXiv (Cornell University)|Nov 24, 2021
Digital Media Forensic Detection被引用 6
一句话总结

本文提出一种轻量级语义分割方法,采用MobileUNet从真实世界图像的杂乱背景中精确分离身份证图像,其在智利身份证数据集上的平均交并比(IoU)达到0.9926,在多国数据集上的平均IoU达到0.9911。该方法针对移动设备上的实时部署进行了优化,显著提升了身份验证和伪造检测系统中下游任务的性能。

ABSTRACT

Removing the background in ID Card images is a real challenge for remote verification systems because many of the re-digitalised images present cluttered backgrounds, poor illumination conditions, distortion and occlusions. The background in ID Card images confuses the classifiers and the text extraction. Due to the lack of available images for research, this field represents an open problem in computer vision today. This work proposes a method for removing the background using semantic segmentation of ID Cards. In the end, images captured in the wild from the real operation, using a manually labelled dataset consisting of 45,007 images, with five types of ID Cards from three countries (Chile, Argentina and Mexico), including typical presentation attack scenarios, were used. This method can help to improve the following stages in a regular identity verification or document tampering detection system. Two Deep Learning approaches were explored, based on MobileUNet and DenseNet10. The best results were obtained using MobileUNet, with 6.5 million parameters. A Chilean ID Card's mean Intersection Over Union (IoU) was 0.9926 on a private test dataset of 4,988 images. The best results for the fused multi-country dataset of ID Card images from Chile, Argentina and Mexico reached an IoU of 0.9911. The proposed methods are lightweight enough to be used in real-time operation on mobile devices.

研究动机与目标

  • 为解决在非受限环境下拍摄的身份证图像中背景干扰的问题,例如光照不良、遮挡和杂乱背景。
  • 开发一种鲁棒的语义分割方法,从复杂背景中分离出身份证区域,以增强身份验证流程中后续阶段的性能。
  • 通过创建并使用包含45,007张来自智利、阿根廷和墨西哥的图像的手动标注数据集,弥补公开、大规模身份证分割数据集的不足。
  • 评估并比较深度学习架构——MobileUNet和DenseNet10——在移动平台上的高效、实时语义分割性能。
  • 通过实现精确、自动的身份证区域提取,提升远程身份验证和文档伪造检测的可靠性。

提出的方法

  • 提出一种语义分割框架,利用深度学习模型将身份证图像中的每个像素分类为前景(身份证)或背景。
  • 该方法采用一个包含45,007张来自三个国家(智利、阿根廷、墨西哥)的手动标注身份证图像的自定义数据集,涵盖真实图像和演示攻击场景。
  • 评估了两种深度学习架构:参数量为650万的MobileUNet和参数量为210,732的轻量化DenseNet10变体。
  • 模型训练采用交叉熵损失函数,并结合数据增强技术,以提升对光照、形变和遮挡的鲁棒性。
  • 推理过程针对移动设备部署进行了优化,输入分辨率设定为448×448像素,以实现最佳性能与速度平衡。
  • 性能评估采用平均交并比(IoU),并在一个包含8,966张图像的私有测试集上测量标准差和推理时间。

实验结果

研究问题

  • RQ1轻量级语义分割模型是否能有效在远程验证系统中从复杂的真实世界背景中分离出身份证?
  • RQ2MobileUNet在跨多国、多样化身份证布局上的分割性能与DenseNet10相比如何?
  • RQ3身份证设计的ICAO合规性在多大程度上影响分割准确率和模型泛化能力?
  • RQ4所提出的方法是否能在保持高分割准确率的同时实现在移动设备上的实时推理?
  • RQ5该模型在演示攻击场景(如合成或伪造身份证)下的表现如何?

主要发现

  • MobileUNet在智利身份证子数据集上实现了0.9926的最高平均IoU,表明其在ICAO合规、高质量身份证上的卓越性能。
  • 在融合的多国数据集(智利、阿根廷、墨西哥)上,MobileUNet实现了0.9911的平均IoU,表明其在不同布局和图像质量下均具有强大的泛化能力。
  • MobileUNet在448×448输入图像上的推理时间为0.023秒,证实其适合实时移动部署。
  • HOG/SVM基线方法在智利图像上的平均IoU仅为0.8671,与最佳深度学习模型相比存在12.5%的性能差距。
  • 尽管图像质量较低且布局不一致,模型在阿根廷和墨西哥身份证上的表现依然出色,平均IoU分别为0.9891和0.9862。
  • 模型对演示攻击表现出鲁棒性,体现在即使在带有人工边框的合成身份证图像上,分割准确率依然很高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。