Skip to main content
QUICK REVIEW

[論文レビュー] Comparing Human and Machine Bias in Face Recognition

Samuel Dooley, Ryan Downing|ArXiv.org|Oct 15, 2021
Face recognition and analysis参考文献 48被引用数 6
ひとこと要約

本研究では、データ欠損を解消するように改良されたLFWおよびCelebAデータセットを収集し、人間(n=545)と機械モデルの両方に対して同一の検証および識別タスクを実施することで、顔認識における人間と機械のバイアスを比較した。両者とも性別および肌の色によるバイアスの程度が類似しており、商業用APIは最小限の顕著な差異を示しながらもほぼ100%の正確性を達成したことが判明した。

ABSTRACT

Much recent research has uncovered and discussed serious concerns of bias in facial analysis technologies, finding performance disparities between groups of people based on perceived gender, skin type, lighting condition, etc. These audits are immensely important and successful at measuring algorithmic bias but have two major challenges: the audits (1) use facial recognition datasets which lack quality metadata, like LFW and CelebA, and (2) do not compare their observed algorithmic bias to the biases of their human alternatives. In this paper, we release improvements to the LFW and CelebA datasets which will enable future researchers to obtain measurements of algorithmic bias that are not tainted by major flaws in the dataset (e.g. identical images appearing in both the gallery and test set). We also use these new data to develop a series of challenging facial identification and verification questions that we administered to various algorithms and a large, balanced sample of human reviewers. We find that both computer models and human survey participants perform significantly better at the verification task, generally obtain lower accuracy rates on dark-skinned or female subjects for both tasks, and obtain higher accuracy rates when their demographics match that of the question. Computer models are observed to achieve a higher level of accuracy than the survey participants on both tasks and exhibit bias to similar degrees as the human survey participants.

研究の動機と目的

  • 既存の顔認識データセットに見られる重大な欠陥(重複画像、誤ったラベルなど)がバイアス測定に与える歪みを是正するため。
  • 制御的でバランスの取れた実験設計を用いて、顔認識システムにおけるアルゴリズム的バイアスと人間バイアスを比較するため。
  • 機械学習モデルが非専門家の人間レビュアーと同等の程度と方向性でバイアスパターンを示すかどうかを評価するため。
  • 人間参加者と比較して、学術的および商業的顔認識モデルの性能を、人種的・性的なマイノリティグループごとに評価するため。
  • 将来的な顔認識における公平性と正確性に関する研究のための、高品質で整理されたデータセットおよびアンケート調査ツールを提供するため。

提案手法

  • LFWおよびCelebAデータセットを手作業で精査・クリーニングし、重複画像、誤ったラベル、品質のばらつきを排除した。
  • 検証(1対1)および識別(1対多)タスクの両方において、性別および肌の色にわたるバランスの取れた表現を備えた新しいデータセットを構築した。
  • 545名の非専門家参加者に対して標準化されたアンケートを実施し、人種的・性的なマイノリティグループにおける顔認識の正確性を評価した。
  • 同じタスクに対して、学術的に訓練された顔認識モデルと商業用API(AWS、Azure、Face++など)を評価した。
  • 性別および肌の色による性能差を分析するため、t検定およびロジスティック回帰を用い、人間と機械の結果を比較した。
  • バイアスの程度を定量化し、統計的有意性を評価するために、95%信頼区間を伴うオッズ比を報告した。

実験結果

リサーチクエスチョン

  • RQ1顔認識システムは、非専門家の人間レビュアーと同等の程度と方向性でバイアスパターンを示すのか?
  • RQ2LFWやCelebAのような標準データセットにおけるデータ品質の問題が、アルゴリズム的バイアスの測定にどのように影響するのか?
  • RQ3被験者と評価者(人間または機械)との間で性的・人種的属性に不一致がある場合、認識正確性にどの程度の影響が生じるのか?
  • RQ4商業用顔認識APIの性能は、学術的モデルおよび人間参加者と比較して、バイアスおよび正確性の観点でどの程度か?
  • RQ5同じデータセットを用いて、顔認識タスクにおける人間と機械の性能を公平に比較できるのか?

主な発見

  • 人間参加者および学術的顔認識モデルの両方が、明るい肌色および男性の被験者に対して比べて、暗い肌色および女性の被験者に対して有意に低い性能を示した。
  • 人間と学術的モデルの両方が、性別バイアスの程度が統計的に類似しており、検証タスクにおける誤識別のオッズ比は、人間で1.33–1.46、モデルで1.02–1.61の範囲であった。
  • 識別タスクにおいても、性別バイアスの影響は類似しており、オッズ比は人間で1.84–2.10、学術的モデルで1.43–2.17の範囲であった。
  • 肌の色バイアス(明るい対暗い)についても、人間とモデルの信頼区間が重複しており、バイアスの程度が同等であることが示された。
  • 商業用API(AWS、Face++)は、両タスクで97.3%以上の正確性を達成し、性別や肌の色にわたる有意な差異は認められなかった。
  • Azureは統計的に有意な男性性別バイアスを示した(オッズ比 = 1.76、p = 0.041)、が、その程度は人間および学術的モデルで観察されたものと同等であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。