Skip to main content
QUICK REVIEW

[论文解读] Age and gender bias in pedestrian detection algorithms

Martim Brandão|arXiv (Cornell University)|Jun 25, 2019
Advanced Neural Network Applications参考文献 11被引用 14
一句话总结

本研究使用扩展版的INRIA行人数据集(包含儿童/成人及男性/女性标签)评估了最先进行人检测算法中的年龄与性别偏差。结果表明,所有24种表现最佳的算法在儿童上的漏检率显著更高——平均高出0.04个百分点,且差异具有统计学意义;而基于性别的性能差异则不显著。

ABSTRACT

Pedestrian detection algorithms are important components of mobile robots, such as autonomous vehicles, which directly relate to human safety. Performance disparities in these algorithms could translate into disparate impact in the form of biased accident outcomes. To evaluate the need for such concerns, we characterize the age and gender bias in the performance of state-of-the-art pedestrian detection algorithms. Our analysis is based on the INRIA Person Dataset extended with child, adult, male and female labels. We show that all of the 24 top-performing methods of the Caltech Pedestrian Detection Benchmark have higher miss rates on children. The difference is significant and we analyse how it varies with the classifier, features and training data used by the methods. Algorithms were also gender-biased on average but the performance differences were not significant. We discuss the source of the bias, the ethical implications, possible technical solutions and barriers.

研究动机与目标

  • 探究最先进行人检测算法是否在行人年龄和性别方面表现出性能偏差。
  • 评估由于算法偏差可能导致自动驾驶汽车中出现不公平安全结果的潜在风险。
  • 分析性能差异的根本原因,特别是数据集偏差和检测难度的影响。
  • 评估此类偏差在真实世界机器人系统中的伦理与技术影响。

提出的方法

  • 由单一标注员为INRIA行人数据集中的每个行人边界框手动添加年龄(儿童/成人)和性别(男性/女性)标签,扩展了该数据集。
  • 采用'忽略区域'方法,对数据集的子集进行算法性能评估,以隔离特定人口群体的性能表现。
  • 使用平均漏检率(IoU阈值为50%)作为性能度量标准,该标准在Caltech行人检测基准中为标准做法。
  • 应用Wilcoxon秩和检验,以确定多个算法在不同人口群体之间性能差异的统计显著性。
  • 使用Caltech行人检测基准的公开评估代码,以确保结果的一致性与可复现性。
  • 将分析重点放在测试集的'合理'子集上(近景、遮挡最少),以排除小边界框效应与年龄/性别效应的混淆。

实验结果

研究问题

  • RQ1最先进行人检测算法对儿童的漏检率是否高于对成人的漏检率?
  • RQ2在这些算法中,男性与女性行人的性能是否存在统计学上显著的差异?
  • RQ3观察到的年龄偏差在多大程度上可归因于数据集分布、模型架构或特征工程?
  • RQ4行人检测中的算法偏差如何可能导致自动驾驶汽车中不平等的安全结果?
  • RQ5在真实世界机器人系统中实现公平行人检测面临哪些伦理与技术障碍?

主要发现

  • Caltech行人检测基准中表现最佳的24种算法对儿童的漏检率均高于对成人的漏检率,且差异具有统计学意义。
  • 儿童与成人之间的平均漏检率差异为0.04个百分点,对于在INRIA/Caltech数据集上训练的算法,该差异最高可达0.07个百分点。
  • 在72%的算法中,女性行人的漏检率高于男性,但性能差异未达到统计学显著性。
  • 年龄偏差很可能是数据集不平衡(训练数据中儿童数量较少)与更小边界框及动态姿势带来的固有检测挑战共同作用的结果。
  • 本研究表明,算法偏差可能导致实际碰撞结果中的显著差异,使儿童更可能被自动驾驶汽车遗漏。
  • 尽管存在偏差,表现最佳的算法(PCN)仍比次优算法更频繁地检测到儿童,表明算法选择在效率与公平性之间存在权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。