Skip to main content
QUICK REVIEW

[论文解读] Demographic Bias in Presentation Attack Detection of Iris Recognition Systems

Meiling Fang, Naser Damer|arXiv (Cornell University)|Mar 6, 2020
Biometric Identification and Security参考文献 23被引用 7
一句话总结

本研究首次将差异表现(differential performance)与差异结果(differential outcome)的概念引入虹膜活体攻击检测(PAD)领域,系统分析了人口统计偏差问题。基于NDCLD-2013数据库,采用手工设计特征(LBP)、迁移学习(MobileNetV3-Small)以及从零开始训练(VGG-16)三种方法,研究发现PAD系统在女性群体中的表现持续低于男性群体,LBP方法在女性中的BPCER达到42.60%,而男性仅为21.85%,表明攻击检测准确率存在显著的性别偏差。

ABSTRACT

With the widespread use of biometric systems, the demographic bias problem raises more attention. Although many studies addressed bias issues in biometric verification, there are no works that analyze the bias in presentation attack detection (PAD) decisions. Hence, we investigate and analyze the demographic bias in iris PAD algorithms in this paper. To enable a clear discussion, we adapt the notions of differential performance and differential outcome to the PAD problem. We study the bias in iris PAD using three baselines (hand-crafted, transfer-learning, and training from scratch) using the NDCLD-2013 database. The experimental results point out that female users will be significantly less protected by the PAD, in comparison to males.

研究动机与目标

  • 探究虹膜活体攻击检测(PAD)系统中的人口统计偏差,这是生物特征识别领域此前未被探索的课题。
  • 将验证任务中的人口统计偏差概念——差异表现与差异结果——适配至PAD场景,以实现系统性分析。
  • 评估训练数据偏差对PAD性能在男性与女性群体中表现的影响。
  • 识别并分析在多种算法方法下,性别差异在PAD准确率中是否以及如何显现。
  • 为虹膜PAD中性别间保护不均提供实证证据,尤其在不同训练数据条件下。

提出的方法

  • 将生物特征验证中的术语‘差异表现’与‘差异结果’适配至PAD分析,聚焦于攻击样本与真实样本的分类错误率。
  • 评估三种PAD基线模型:手工设计特征的LBP、基于迁移学习的MobileNetV3-Small,以及在NDCLD-2013数据库上从零开始训练的VGG-16。
  • 设计两种实验设置:一种使用混合性别的训练数据,另一种使用性别专属的训练数据(仅男性或仅女性)。
  • 以APCER(攻击样本分类错误率)与BPCER(真实样本分类错误率)作为关键指标,阈值选择基于开发集中固定的APCER。
  • 使用HTER(半总错误率)评估不同人口统计群体中的整体PAD性能。
  • 通过比较不同训练与测试配置下男性与女性受试者的错误率差异,分析性能差异。

实验结果

研究问题

  • RQ1虹膜活体攻击检测系统中是否存在人口统计偏差,特别是在男性与女性受试者之间的差异表现?
  • RQ2训练数据构成(混合性别 vs. 单性别)如何影响PAD算法的公平性?
  • RQ3某些PAD算法是否比其他算法更易对女性受试者产生性别偏差,导致攻击检测能力下降?
  • RQ4在多个PAD基线模型中,男性与女性受试者的错误率(APCER、BPCER、HTER)差异程度如何?
  • RQ5观察到的偏差是否可归因于训练集中女性样本的稀缺性或不平衡?

主要发现

  • LBP方法在女性中的BPCER显著更高(42.60%),而男性仅为21.85%,表明对女性的检测准确率更低。
  • 当在混合数据上训练时,MobileNetV3-Small在女性中的APCER为9.23%,高于男性的8.11%,表明对女性的攻击检测能力下降。
  • 当仅在女性数据上训练时,VGG-16在女性中的BPCER为0%,但将100%的男性攻击样本误判为真实样本,表明严重泛化失败。
  • 在性别专属训练设置下,LBP在女性中的HTER为30.36%,高于男性的23.29%,证实对女性的整体性能更差。
  • 即使真实样本数量相等,LBP在女性中的HTER(25.53%)仍高于男性(21.85%),表明对女性攻击样本的分类存在固有困难。
  • 在女性数据上训练的VGG-16模型在混合测试数据上的HTER为50.00%,而同一模型在男性数据上训练的HTER仅为9.19%,凸显其在泛化中存在强烈的性别偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。