[論文レビュー] One Label, One Billion Faces: Usage and Consistency of Racial Categories in Computer Vision
本研究では、ラベル付き顔データセットに埋め込まれた暗黙の民族的システムを学ぶように分類器を訓練することにより、コンピュータビジョンデータセットにおける人種カテゴリーのクロスデータセット一貫性を調査する。その結果、人種カテゴリーはデータセット間で著しく不一致であり、しばしば人種的ステレオタイプを含み、ステレオタイプに合わない民族的グループを除外しており、AIにおける公平性指標や多様性の主張を損なっていることが判明した。
Computer vision is widely deployed, has highly visible, society altering applications, and documented problems with bias and representation. Datasets are critical for benchmarking progress in fair computer vision, and often employ broad racial categories as population groups for measuring group fairness. Similarly, diversity is often measured in computer vision datasets by ascribing and counting categorical race labels. However, racial categories are ill-defined, unstable temporally and geographically, and have a problematic history of scientific use. Although the racial categories used across datasets are superficially similar, the complexity of human race perception suggests the racial system encoded by one dataset may be substantially inconsistent with another. Using the insight that a classifier can learn the racial system encoded by a dataset, we conduct an empirical study of computer vision datasets supplying categorical race labels for face images to determine the cross-dataset consistency and generalization of racial categories. We find that each dataset encodes a substantially unique racial system, despite nominally equivalent racial categories, and some racial categories are systemically less consistent than others across datasets. We find evidence that racial categories encode stereotypes, and exclude ethnic groups from categories on the basis of nonconformity to stereotypes. Representing a billion humans under one racial category may obscure disparities and create new ones by encoding stereotypes of racial systems. The difficulty of adequately converting the abstract concept of race into a tool for measuring fairness underscores the need for a method more flexible and culturally aware than racial categories.
研究の動機と目的
- コンピュータビジョンデータセットで用いられる人種カテゴリーのクロスデータセット一貫性を調査すること。
- 人種カテゴリーが人種的ステレオタイプを含んでおり、非適合な民族的グループを除外しているかどうかを評価すること。
- 異なるデータセット間での人種アノテーションの一般化性と信頼性を評価すること。
- AIシステムにおいて人種を固定的・カテゴリー化されたラベルとして実体化することの危険性を浮き彫りにすること。
- 機械学習における公平性と多様性の指標として人種カテゴリーを代理指標として使用することの妥当性を疑うこと。
提案手法
- 4つの主要なフェアなコンピュータビジョンデータセット(カテゴリカルな人種ラベルを備える)に複数の画像分類器を訓練した。
- データセット間での分類器の合意度を用いて、人種カテゴリー境界の一貫性を測定する指標とした。
- 特にステレオタイプに合わない民族的グループに対して、個人がどの程度一貫して人種カテゴリーに割り当てられているかを評価した。
- 民族的グループがデータセットに埋め込まれた人種的ステレオタイプにどの程度適合しているかをテストするために、小規模な手作業によるアノテーションデータセットを収集した。
- アフリカ東部(例:エチオピア)と西・中央アフリカ(例:ガンビア)の出身者に対するラベリングの不一致を分析し、地理的・文化的バイアスを検出した。
- 異なるデータセット間での分類器の予測を比較し、体系的なステレオタイピングや除外パターンを検出した。
実験結果
リサーチクエスチョン
- RQ1同じ名目的人種カテゴリーを用いても、異なるコンピュータビジョンデータセット間で人種カテゴリーの割り当てはどの程度一貫しているのか?
- RQ2データセットの人種カテゴリーは、社会的・文化的要因や民族的アイデンティティよりも、人種的ステレオタイプをどの程度反映しているのか?
- RQ3ステレオタイプに合わない民族的グループ(例:東アフリカ系)は、データセット間でラベリングの一貫性がどの程度保たれているのか?
- RQ4人種ラベリングの一貫性の欠如が、AIにおける公平性評価や多様性測定にどのような影響を及えるのか?
- RQ5データセット収集の文化的・地理的文脈が、コンピュータビジョンにおける人種カテゴリーの構築にどのように影響しているのか?
主な発見
- 各データセットは、同じ名目的人種カテゴリーを用いていながらも、顕著に異なる人種システムを埋め込んでいる。
- 人種カテゴリーは体系的なラベリングの不一致を示しており、一部のグループ(例:東アフリカ系)が複数のデータセットで一貫して「Black」とラベル付けされていないことが判明した。
- 分類器は、特定のカテゴリーの支配的外見的特徴と一致しない個人の人種について、異なるデータセットで著しく異なる予測を行うことが多かった。
- 本研究では、エチオピア出身者がガンビア出身者よりも「Black」として一貫してラベル付けされていないことが判明し、データセット構築における地理的・文化的バイアスが示唆された。
- データセットの人種カテゴリーは、一般的な外見的ステレオタイプに合わない民族的グループをしばしば除外または誤解を招く形で表現している。
- データセットを通じて人種を実体化することは、特にAIシステム間でデータセットが再利用・拡散される際、歴史的・文化的バイアスを強化するリスクを伴う。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。