Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating Proposed Fairness Models for Face Recognition Algorithms

John J. Howard, Eli Laird|arXiv (Cornell University)|Mar 9, 2022
Face recognition and analysis被引用数 5
ひとこと要約

この論文は、126のアルゴリズムの文化的・人種的・性別的属性に応じた誤差率をデマグラフィックに分解した、新たに公開されたデータセットを用いて、顔認識アルゴリズムのための2つの既存の公平性指標を評価している。解釈可能性を高めるための機能的公平性指標基準(FFMC)を提案し、精度と公平性のバランスを取るためのペアトレ最適化を組み合わせた新しい公平性指標GARBEを導入することで、実世界の展開におけるアルゴリズム選定の実用的フレームワークを提供する。

ABSTRACT

The development of face recognition algorithms by academic and commercial organizations is growing rapidly due to the onset of deep learning and the widespread availability of training data. Though tests of face recognition algorithm performance indicate yearly performance gains, error rates for many of these systems differ based on the demographic composition of the test set. These "demographic differentials" in algorithm performance can contribute to unequal or unfair outcomes for certain groups of people, raising concerns with increased worldwide adoption of face recognition systems. Consequently, regulatory bodies in both the United States and Europe have proposed new rules requiring audits of biometric systems for "discriminatory impacts" (European Union Artificial Intelligence Act) and "fairness" (U.S. Federal Trade Commission). However, no standard for measuring fairness in biometric systems yet exists. This paper characterizes two proposed measures of face recognition algorithm fairness (fairness measures) from scientists in the U.S. and Europe. We find that both proposed methods are challenging to interpret when applied to disaggregated face recognition error rates as they are commonly experienced in practice. To address this, we propose a set of interpretability criteria, termed the Functional Fairness Measure Criteria (FFMC), that outlines a set of properties desirable in a face recognition algorithm fairness measure. We further develop a new fairness measure, the Gini Aggregation Rate for Biometric Equitability (GARBE), and show how, in conjunction with the Pareto optimization, this measure can be used to select among alternative algorithms based on the accuracy/fairness trade-space. Finally, we have open-sourced our dataset of machine-readable, demographically disaggregated error rates. We believe this is currently the largest open-source dataset of its kind.

研究の動機と目的

  • 顔認識アルゴリズムのための2つの提案された公平性指標の解釈可能性と実用的有用性を評価すること。
  • 人種と性別で分類された実世界の誤差率データに適用された際の、既存の公平性指標の欠陥を特定すること。
  • バイオメトリクスシステムにおける公平性指標を評価するための、解釈可能性基準のセット、すなわち機能的公平性指標基準(FFMC)を確立すること。
  • 精度と公平性のトレードオフを効果的にバランスできる新しい公平性指標、Gini集約率 for バイオメトリック公平性(GARBE)を設計すること。
  • GitHubにデータとコードを公開することで、透明性と再現可能性を促進し、MLの公平性研究を支援すること。

提案手法

  • 著者は、NISTレポートから126の顔認識アルゴリズムの誤差率を収集・解析し、人種と性別ごとに分解して機械可読形式のCSVデータセットにした。
  • このデータセットを用いて、2つの既存の公平性指標の数学的性質と実世界の文脈における解釈可能性を分析した。
  • 機能的公平性指標基準(FFMC)は、単調性、有界性、文化的差異への感受性といった望ましい性質のセットとして定義された。
  • Gini係数に基づいて、Gini集約率 for バイオメトリック公平性(GARBE)と呼ばれる新しい公平性指標を開発した。
  • 精度と公平性のトレードオフ空間全体で最適なバランスを達成するため、ペアトレ最適化を適用した。
  • データセットとコードをGitHubにリリースし、今後のML公平性研究を支援した。

実験結果

リサーチクエスチョン

  • RQ1実世界の文化的・人種的・性別的属性に応じた顔認識誤差率に適用された際、既存の公平性指標はどの程度の性能を示すか?
  • RQ2バイオメトリクスシステムにおける公平性指標に求められる数学的性質と解釈可能性の性質は何か?
  • RQ3精度と公平性の両方を文化的・人種的・性別的属性にわたって効果的にバランスできる新しい公平性指標を設計できるか?
  • RQ4現在の公平性指標は、統計的公平性を超えて、人間の直感的または社会的な公平性の概念をどの程度反映しているか?
  • RQ5オープンデータと標準化された評価フレームワークは、顔認識における堅牢な公平性指標の開発をどの程度向上させられるか?

主な発見

  • 評価された2つの公平性指標は、特に小規模なグループが存在する状況において、実世界の誤差率データに適用された際の解釈が困難な数学的性質を示した。
  • 提案された機能的公平性指標基準(FFMC)は、バイオメトリクス応用における公平性指標の適切さを評価するための構造的フレームワークを提供する。
  • GARBE指標は文化的・人種的・性別的属性にわたる公平性の度合いを的確に測定でき、精度と公平性のトレードオフ空間における効果的なペアトレ最適化を可能にした。
  • 126の顔認識アルゴリズムの文化的・人種的・性別的属性に応じた誤差率をデマグラフィックに分解したデータセットは、これまでに公開された中で最大級のものである。
  • 本研究は、公平性監査を向上させるために、文化的内誤差率やマルチスレッショルド性能を含む、より包括的なデータセットの必要性を浮き彫りにした。
  • 数学的公平性と直感的公平性の間には依然として重要なギャップが存在し、統計的に公平であるシステムでも、ユーザーからは不公平に感じられる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。