[论文解读] Minutiae-Guided Fingerprint Embeddings via Vision Transformers
该论文提出了一种基于视觉变换器(ViT)的指纹嵌入模型,通过细纹特征进行引导,以提升识别准确率与效率。通过在ViT输入中引入领域特定的细纹监督,该方法在NIST SD30数据集上实现了接近最先进水平的性能(FAR=0.1%时TAR=94.23%),并使匹配速度比商用系统快50倍(250万次匹配/秒)。
Minutiae matching has long dominated the field of fingerprint recognition. However, deep networks can be used to extract fixed-length embeddings from fingerprints. To date, the few studies that have explored the use of CNN architectures to extract such embeddings have shown extreme promise. Inspired by these early works, we propose the first use of a Vision Transformer (ViT) to learn a discriminative fixed-length fingerprint embedding. We further demonstrate that by guiding the ViT to focus in on local, minutiae related features, we can boost the recognition performance. Finally, we show that by fusing embeddings learned by CNNs and ViTs we can reach near parity with a commercial state-of-the-art (SOTA) matcher. In particular, we obtain a TAR=94.23% @ FAR=0.1% on the NIST SD 302 public-domain dataset, compared to a SOTA commercial matcher which obtains TAR=96.71% @ FAR=0.1%. Additionally, our fixed-length embeddings can be matched orders of magnitude faster than the commercial system (2.5 million matches/second compared to 50K matches/second). We make our code and models publicly available to encourage further research on this topic: https://github.com/tba.
研究动机与目标
- 探索使用视觉变换器(ViT)学习固定长度指纹嵌入,作为传统基于细纹匹配的替代方案。
- 通过引导注意力和输入级监督,将指纹细纹作为归纳偏置整合到ViT中,以提升其性能。
- 证明ViT学习的嵌入与基于CNN的嵌入具有互补性,通过特征融合可实现性能提升。
- 在保持高准确率的同时,实现显著快于商用细纹匹配系统的匹配速度。
提出的方法
- 在指纹图像上训练视觉变换器(ViT),使用对比学习目标学习固定长度嵌入。
- 通过将纹线图像与一个编码细纹位置和方向的双通道图拼接,引入细纹引导的输入表示。
- 在训练过程中应用蒸馏损失,促使ViT的注意力机制和特征学习与细纹的空间分布对齐。
- 通过后期元素平均法融合ViT和CNN(ResNet-50)学习到的嵌入,以结合互补特征。
- 采用包含困难负样本挖掘的对比学习框架,以提升嵌入的可分性。
- 在标准指纹识别基准测试集(NIST SD30、SD4和SD14数据集)上评估性能,涵盖闭集与开集协议。
实验结果
研究问题
- RQ1当在不依赖传统细纹匹配的指纹图像上进行训练时,视觉变换器(ViT)能否实现具有竞争力的指纹识别性能?
- RQ2将细纹领域知识整合到ViT输入中,对识别准确率和鲁棒性有何影响?
- RQ3ViT和CNN模型学习到的特征是否具有互补性,使得融合后能提升整体性能?
- RQ4ViT学习的嵌入能否在保持高准确率的同时,实现显著快于商用细纹匹配系统的匹配速度?
主要发现
- 细纹引导的ViT在NIST SD30数据集上实现了FAR=0.1%时TAR=94.23%的性能,接近商用最先进匹配器(96.71%)的水平。
- 在闭集识别中,该ViT模型优于原始ViT和ResNet-50基线模型,尤其在引入细纹监督进行微调后表现更优。
- 在开集识别中,细纹蒸馏的ViT优于原始ViT,并在多个FPIR工作点上达到或超过ResNet-50的性能。
- ViT与CNN嵌入的融合实现了最高性能,证明了两种架构学习到的特征具有互补性。
- 基于ViT的系统实现了每秒250万次匹配,相比商用系统(5万次匹配/秒)实现了50倍的速度提升。
- 显著性图可视化表明,细纹引导的ViT能关注更多指纹图像区域,尤其在遮挡情况下更关注局部特征,而CNN则忽略大片图像区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。