Skip to main content
QUICK REVIEW

[論文レビュー] Bias and Fairness on Multimodal Emotion Detection Algorithms

Matheus Schmitz, Rehan Ahmed|arXiv (Cornell University)|May 11, 2022
Emotion and Mood Recognition被引用数 7
ひとこと要約

本研究では、音声、テキスト、映像の3モダリティを用いたマルチモーダル感情認識システムにおける性別バイアスを調査する。テキストのみのモデルがパフォーマンスと公平性のバランスが最も良く、マルチモーダル統合、特に映像の追加によりバイアスが顕著に増大する一方で、精度の向上は最小限にとどまることが判明し、モデル設計選択に倫理的な懸念が生じる。

ABSTRACT

Numerous studies have shown that machine learning algorithms can latch onto protected attributes such as race and gender and generate predictions that systematically discriminate against one or more groups. To date the majority of bias and fairness research has been on unimodal models. In this work, we explore the biases that exist in emotion recognition systems in relationship to the modalities utilized, and study how multimodal approaches affect system bias and fairness. We consider audio, text, and video modalities, as well as all possible multimodal combinations of those, and find that text alone has the least bias, and accounts for the majority of the models' performances, raising doubts about the worthiness of multimodal emotion recognition systems when bias and fairness are desired alongside model performance.

研究の動機と目的

  • 音声、テキスト、映像の3モダリティを用いた単モダルおよびマルチモーダル感情認識モデルにおける性別バイアスの変動を調査すること。
  • 保護属性(性別)からの条件付き確率の独立性に基づき定義される統計的公平性(SP)と機会の平等(EO)という公平性指標を、異なるモダリティの組み合わせに対して評価すること。
  • マルチモーダル統合が、性別に基づく格差を悪化させることなくパフォーマンスを向上させるかを検証すること。
  • テキスト、音声、映像のどのモダリティが感情認識システムにおけるバイアスに本質的に寄与しているかを特定すること。
  • 映像と音声の統合が、わずかなパフォーマンス向上に対して公平性の低下というトレードオフをもたらすことを評価すること。

提案手法

  • 研究では、IEMOCAPデータセットを用い、信頼度が低く、レアな感情ラベルを除外することで、7,380件のサンプルで構成され、性別が50/50にバランスされたデータセットを構築した。
  • 訓練・検証・テストの分割は、セッション1〜4を訓練、セッション5を偶数(検証)と奇数(テスト)の発話に分割し、80/10/10の比率とした。
  • 公平性は2つの指標で測定された:統計的公平性差(SP)と機会の平等差(EO)。これらは保護属性(性別)からの条件付き確率の独立性に基づいて定義された。
  • 単モダル(音声、テキスト、映像)およびマルチモダル(二モダルおよび三モダル)構成の両方において、転移学習を用いてモデルを訓練した。
  • パフォーマンスは、性別間のF1スコア差で評価され、値が低いほど公平性が高いことを示した。
  • 統計的公平性と機会の平等は、各感情とモデル構成ごとに計算され、モダリティ全体におけるバイアスの傾向を評価した。

実験結果

リサーチクエスチョン

  • RQ1音声、テキスト、映像の3モダリティを用いた単モダル感情認識モデルにおける性別バイアスはどのように変動するか?
  • RQ2音声、テキスト、映像のマルチモーダル統合は、単モダルモデルと比較して性別バイアスを軽減するか、悪化させるか?
  • RQ3モダリティを統合する際の、モデルのパフォーマンス(F1スコア)と公平性(SPおよびEO)のトレードオフはいかなるものか?
  • RQ4なぜ、テキストを含むモデルは、男性と女性の怒りの予測において常に10%のF1スコアギャップを示すのか?
  • RQ5映像データの統合が、わずかなパフォーマンス向上に対して、公平性をどの程度悪化させるのか?

主な発見

  • テキストのみのモデルが最もバイアスが少なく、統計的公平性差(SP)は2.0、機会の平等差(EO)は1.43であり、他のすべてのモダリティよりも公平性が優れている。
  • 映像のみのモデルは最もバイアスが強く、SPは3.0、EOは2.32であり、性別間の予測確率に顕著な差が生じている。
  • 音声のみのモデルは映像よりバイアスが少なく、テキストよりはやや高いが、SPは1.0、EOは1.82である。
  • 音声+映像の二モダル統合では、単一音声モデルに比べてバイアスが増加し、SPは2.0に上昇、EOは2.22にまで上昇したが、F1スコアの向上はわずかであった。
  • テキスト+映像の統合では、公平性が最も悪化し、SPは6.0、EOは3.24に達し、予測に顕著な性別差が生じている。
  • 音声+テキスト+映像の三モダルモデルは、テキストのみのモデルと同等の公平性指標(SP: 2.0、EO: 2.68)を達成したが、テキスト単体に比べてF1スコアの向上はわずかであった。これにより、統合による顕著な利点は得られないと結論づけられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。