[論文レビュー] Minutiae-Guided Fingerprint Embeddings via Vision Transformers
この論文は、特徴点を用いてガイドされたVision Transformer (ViT)ベースの指紋埋め込みモデルを提案し、認識精度と効率を向上させることを目的としている。分野特有の特徴点の監視をViTの入力に組み込むことで、NIST SD30で準最先端の性能(FAR=0.1%のときTAR=94.23%)を達成し、商用システムよりも50倍速い(1秒間に250万マッチ)マッチングを実現した。
Minutiae matching has long dominated the field of fingerprint recognition. However, deep networks can be used to extract fixed-length embeddings from fingerprints. To date, the few studies that have explored the use of CNN architectures to extract such embeddings have shown extreme promise. Inspired by these early works, we propose the first use of a Vision Transformer (ViT) to learn a discriminative fixed-length fingerprint embedding. We further demonstrate that by guiding the ViT to focus in on local, minutiae related features, we can boost the recognition performance. Finally, we show that by fusing embeddings learned by CNNs and ViTs we can reach near parity with a commercial state-of-the-art (SOTA) matcher. In particular, we obtain a TAR=94.23% @ FAR=0.1% on the NIST SD 302 public-domain dataset, compared to a SOTA commercial matcher which obtains TAR=96.71% @ FAR=0.1%. Additionally, our fixed-length embeddings can be matched orders of magnitude faster than the commercial system (2.5 million matches/second compared to 50K matches/second). We make our code and models publicly available to encourage further research on this topic: https://github.com/tba.
研究の動機と目的
- 従来の特徴点ベースのマッチングに依存せずに、固定長の指紋埋め込みを学習するためのVision Transformer (ViT) の利用を検討すること。
- ガイドドアテンションと入力レベルの監視を用いて、指紋特徴点をインダクティブバイアスとして統合することで、ViTの性能を向上させること。
- ViTベースの埋め込みとCNNベースの埋め込みが相補的であることを示し、それらの融合によって性能向上を達成すること。
- 高い精度を維持しながら、商用の特徴点ベースシステムよりも著しく高速なマッチング速度を実現すること。
提案手法
- 対照的学習の目的関数を用いて、指紋画像上でVision Transformer (ViT) を訓練し、固定長の埋め込みを学習する。
- 指紋のリッジ画像と、特徴点の位置と方向をエンコードする2チャネルマップを連結することで、特徴点ガイドド入力表現を導入する。
- トレーニング中に、ViTが特徴点の空間的分布と一致するようにアテンションと特徴学習を促す蒸留損失を適用する。
- ViTとCNN(ResNet-50)の学習済み埋め込みを、後段の平均化を用いて融合し、相補的な特徴を組み合わせる。
- 埋め込みの識別性を向上させるために、ハードネガティブマイニングを用いた対照的学習フレームワークを採用する。
- 標準的な指紋認識ベンチマーク(NIST SD30、SD4、SD14データセット)を用い、クローズドセットおよびオープンセットの両プロトコルで性能を評価する。
実験結果
リサーチクエスチョン
- RQ1従来の特徴点マッチングに依存せずに、指紋画像上でトレーニングされたVision Transformer (ViT) が、競争力のある指紋認識性能を達成できるか?
- RQ2ViTの入力に指紋特徴点の分野知識を組み込むことで、認識精度と耐障害性にどのような影響を与えるか?
- RQ3ViTとCNNの両モデルが学習する特徴は相補的であると見なせるか? その融合によって全体の性能が向上するか?
- RQ4ViTベースの埋め込みは、商用の特徴点ベースシステムよりも著しく高速なマッチングを実現できるか? また、高い精度を維持できるか?
主な発見
- 特徴点ガイドドViTは、NIST SD30データセットでFAR=0.1%のときTAR=94.23%を達成し、商用の最先端マッチャー(96.71%)に近い性能を示した。
- クローズドセット識別において、ヴァナラViTおよびResNet-50ベースラインと比較して、特徴点監視で微調整されたViTが優れた性能を示した。
- オープンセット識別において、特徴点蒸留されたViTはヴァナラViTを上回り、複数のFPIR動作点でResNet-50と同等またはそれを上回った。
- ViTとCNNの埋め込みの融合により最高の性能が達成され、両アーキテクチャ間の相補的特徴学習が実証された。
- ViTベースのシステムは1秒間に250万マッチを実現し、商用システム(1秒間に5万マッチ)と比較して50倍の高速化を達成した。
- サリエンシーマップの可視化により、特徴点ガイドドViTが指紋画像全体に焦点を当て、特に遮蔽状態でも局所的特徴に注目しているのに対し、CNNは広い画像領域を無視していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。