Skip to main content
QUICK REVIEW

[論文レビュー] Assessing Demographic Bias Transfer from Dataset to Model: A Case Study in Facial Expression Recognition

Iris Dominguez-Catena, Daniel Paternain|arXiv (Cornell University)|May 20, 2022
Emotion and Mood Recognition被引用数 4
ひとこと要約

本稿は、顔の感情認識(FER)におけるデータセットからモデルへのデモグラフィックバイアスの伝達を評価するための新規メトリクスフレームワークを提案する。主に人種および性別の表象的不均衡とステレオタイプ的バイアスに焦点を当てている。AffectNetデータセットを用いて、顕著な人種的過小代表化と性別ステレオタイプの存在を明らかにした。モデルへのバイアス伝達において、性別バイアスは強く影響を及ぼすが、人種バイアスはデータセットのバランス調整後でさえもモデル性能に顕著な影響を及ぼさないことが示された。

ABSTRACT

The increasing amount of applications of Artificial Intelligence (AI) has led researchers to study the social impact of these technologies and evaluate their fairness. Unfortunately, current fairness metrics are hard to apply in multi-class multi-demographic classification problems, such as Facial Expression Recognition (FER). We propose a new set of metrics to approach these problems. Of the three metrics proposed, two focus on the representational and stereotypical bias of the dataset, and the third one on the residual bias of the trained model. These metrics combined can potentially be used to study and compare diverse bias mitigation methods. We demonstrate the usefulness of the metrics by applying them to a FER problem based on the popular Affectnet dataset. Like many other datasets for FER, Affectnet is a large Internet-sourced dataset with 291,651 labeled images. Obtaining images from the Internet raises some concerns over the fairness of any system trained on this data and its ability to generalize properly to diverse populations. We first analyze the dataset and some variants, finding substantial racial bias and gender stereotypes. We then extract several subsets with different demographic properties and train a model on each one, observing the amount of residual bias in the different setups. We also provide a second analysis on a different dataset, FER+.

研究の動機と目的

  • FERのようなマルチクラス・マルチデモグラフィック問題において、従来のメトリクスがデータセットバイアスとモデルバイアスを分離できないという課題に対処するための公平性メトリクスの欠如を解消すること。
  • 訓練データから訓練済みモデルへのバイアス伝達を体系的に測定するための手法を構築し、バイアス緩和戦略の評価を可能にすること。
  • 特にAffectNetを含む実世界のFERデータセットにおけるデモグラフィックバイアス(表象的不均衡およびステレオタイプ的関連性を含む)を分析すること。
  • 人種や性別によるデータセットレベルのバイアス緩和(例:人種や性別によるバランス調整)が、訓練済みモデルの残存バイアスに与える影響を評価すること。
  • 第二のデータセット(FER+)を用いて、異なるデータ分布においても同様の結果が有効であるかを検証すること。

提案手法

  • 表象的不均衡とステレオタイプ的バイアス(NMI/NPMIを用いて)を測定する2つの新規メトリクスと、モデルの残存バイアスを測定する1つの新規メトリクスを提案。
  • 顔画像の顔認識から顔の外見的特徴に基づき、実際の人種および性別を推定するための事前学習済みモデルであるFairFaceを用い、顔認識データセットAffectNetおよびFER+において、真のデモグラフィック属性が入手できない場合にその推定を行う。
  • 正規化相互情報量(NMI)および正規化ポイントワイズ相互情報量(NPMI)を用いて、デモグラフィックグループと感情クラスとの間のステレオタイプ的関連性を定量化する。
  • 各感情クラスごとに異なるデモグラフィックグループにおける再現率のばらつきを捉える1つの値で表されるメトリクス(OD)を用いて、モデルバイアスを測定する。
  • 複数のデータセットバージョン(層別抽出、人種バランス、性別バランス)を用いてモデルを学習し、バイアス伝達の差を比較する。
  • 学習サイズを変化させた定量的分析を実施し、バイアス伝達に与えるデータ量と品質の影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1AffectNetデータセットにおける表象的不均衡は、顔の感情認識におけるモデルの公平性にどの程度影響を及えるか?
  • RQ2特定の感情と関連づけられるデモグラフィックグループの過小または過大代表化といったステレオタイプ的バイアスは、モデルの予測にどのように影響を及えるか?
  • RQ3人種や性別によるデータセットのバランス調整によって、訓練済みモデルの残存バイアスは低下するか。もし低下するならば、どのデモグラフィック要因がより強い影響を及えるか?
  • RQ4学習データサイズが、表象的バイアスやステレオタイプ的バイアスとは独立して、データセットからモデルへのバイアス伝達にどのように影響を及えるか?
  • RQ5提案されたメトリクスは、異なるFERデータセットおよびモデル設定において、バイアス伝達の検出および定量化に有効であるか?

主な発見

  • AffectNetデータセットには顕著な表象的不均衡が見られ、特定の人種グループの過小代表化と他のグループの過大代表化が顕著に認められた。
  • 性別に関するステレオタイプ的バイアスは顕著で、女性は「嬉しい」や「悲しむ」などの特定の感情と過剰に関連づけられる一方、男性は感情的カテゴリーにおいて過小代表化されている。
  • 人種によるバランス調整を行ったにもかかわらず、訓練済みモデルの人の人種バイアスはほとんど変化しなかった。これは、人種バイアスの伝達が単純なバランス調整では容易に緩和されないことを示唆している。
  • 性別バランスの取れたデータセットを用いることで、モデルバイアスが顕著に低減した。これは、データ内での性別ステレオタイプがモデルの予測に強く影響していることを示している。
  • 表象的バイアスおよびステレオタイプ的バイアスを一定に保ったまま、学習データサイズが増加するにつれてモデルバイアスが低下した。これは、データ量の増加がバイアス緩和に寄与することを示唆している。
  • 提案されたメトリクスはバイアス伝達を効果的に定量化できており、このFER文脈において、性別バイアスが人種バイアスよりもモデルの公平性により大きな影響を及えることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。