Skip to main content
QUICK REVIEW

[論文レビュー] Responsible AI: Gender bias assessment in emotion recognition

Artem Domnich, Gholamreza Anbarjafari|arXiv (Cornell University)|Mar 21, 2021
Face recognition and analysis参考文献 110被引用数 10
ひとこと要約

本研究では、SASE-FEデータセットを用いて訓練された6つのニューラルネットワークを用いて、深層学習モデルにおける性別バイアスを顔の感情認識の文脈で評価する。ResNet50のようなモデルは、Upset や Sad といった感情の分類において顕著な性別バイアスを示す一方、SENetLSTM のようなアーキテクチャは男性・女性のテストセットにおいてより公平な性能を示しており、性別による認識精度および真正陽性・偽陽性率の差が顕著であることが明らかになった。

ABSTRACT

Rapid development of artificial intelligence (AI) systems amplify many concerns in society. These AI algorithms inherit different biases from humans due to mysterious operational flow and because of that it is becoming adverse in usage. As a result, researchers have started to address the issue by investigating deeper in the direction towards Responsible and Explainable AI. Among variety of applications of AI, facial expression recognition might not be the most important one, yet is considered as a valuable part of human-AI interaction. Evolution of facial expression recognition from the feature based methods to deep learning drastically improve quality of such algorithms. This research work aims to study a gender bias in deep learning methods for facial expression recognition by investigating six distinct neural networks, training them, and further analysed on the presence of bias, according to the three definition of fairness. The main outcomes show which models are gender biased, which are not and how gender of subject affects its emotion recognition. More biased neural networks show bigger accuracy gap in emotion recognition between male and female test sets. Furthermore, this trend keeps for true positive and false positive rates. In addition, due to the nature of the research, we can observe which types of emotions are better classified for men and which for women. Since the topic of biases in facial expression recognition is not well studied, a spectrum of continuation of this research is truly extensive, and may comprise detail analysis of state-of-the-art methods, as well as targeting other biases.

研究の動機と目的

  • 責任あるAIの枠組みにおいて、ディープラーニングベースの顔の感情認識(FER)システムにおける性別バイアスを調査すること。
  • トレーニングデータの構成(男性のみ、女性のみ、混合)が、性別ごとのモデルの公平性およびパフォーマンスに与える影響を評価すること。
  • 複数の公平性定義を用いて、感情分類において最も偏りが少なく、最も偏りのあるニューラルネットワークアーキテクチャを特定すること。
  • 真正陽性率および偽陽性率を含めた、性別ごとの感情認識精度の差を分析すること。
  • 感情ごとの主要なバイアスおよびモデル行動を特定することで、今後のFER分野における公平性研究の基盤を提供すること。

提案手法

  • SASE-FEデータセットを用いて、顔の感情認識のための6つの異なる深層ニューラルネットワークアーキテクチャ(3D-CNN、ResNet、VGGFACE、SENetLSTM)を訓練した。
  • 男性被験者のみ、女性被験者のみ、および全体のテストセットの3つのデータ分割を用いて、性別特化型のパフォーマンスを評価した。
  • バイアス評価のため、3つの公平性定義(等しい機会、等しいオッズ、デモグラフィックパリティ)を適用した。
  • パフォーマンス指標として、正解率、真正陽性率(TPR)、偽陽性率(FPR)を用い、男性および女性のテストセット間での比較を実施した。
  • スクラッチから訓練したモデルと事前学習済み重みを用いたモデルの両方を用いてアブレーションスタディを実施し、バイアスおよび公平性に与える影響を評価した。
  • 各感情ごとのパフォーマンスを分析し、男性と女性の間でより正確に認識された感情、または誤分類されやすい感情を特定した。

実験結果

リサーチクエスチョン

  • RQ1どの顔の感情認識用ディープラーニングアーキテクチャが、公平性定義に基づいて最も高い性別バイアスを示すか?
  • RQ2トレーニングデータの構成(男性のみ vs. 女性のみ vs. 混合)は、性別ごとのモデルの公平性およびパフォーマンスにどのように影響するか?
  • RQ3特定の感情が、一方の性別に対して一貫して誤分類されやすい傾向があるか?
  • RQ4公平性指標(等しい機会、等しいオッズ、デモグラフィックパリティ)と、男性・女性テストセット間の正解率の乖離はどの程度相関しているか?
  • RQ5異なるモデルにおいて、男性被験者と女性被験者との間で真正陽性率および偽陽性率にどのような差が生じるか?

主な発見

  • ResNet50は、等しい機会および等しいオッズの基準において最も高い性別バイアスを示し、男性・女性のテストセット間で顕著な正解率の差が認められた。
  • ResNet3DおよびVGGFACEは、デモグラフィックパリティ基準において2番目にバイアスが強いと評価され、性別による予測の公平性に顕著な差が生じた。
  • SENetLSTMは、3つの公平性定義すべてにおいて最も公平なアーキテクチャとして浮き彫りとなり、男性・女性のテストセット間でのパフォーマンス差が最小限に抑えられた。
  • Upsetは全体として最も誤分類されやすく、正解率が最低であったが、特に男性被験者において顕著に低かった。一方、Happyは一貫して最も正確に認識された感情であった。
  • 女性データのみで訓練されたモデルは、男性テストセットでの推論において、女性テストセットでの推論よりも高い正解率を示した。これは予期しないデータ一般化効果を示唆している。
  • 男性データのみで訓練されたモデルは、女性テストセットでのパフォーマンスに高いばらつきを示し、逆性別への一般化において不安定で、耐性が低いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。