Skip to main content
QUICK REVIEW

[論文レビュー] A Friendly Face: Do Text-to-Image Systems Rely on Stereotypes when the Input is Under-Specified?

Kathleen Fraser, Svetlana Kiritchenko|arXiv (Cornell University)|Feb 14, 2023
Social and Intergroup Psychology被引用数 12
ひとこと要約

この論文は、テキスト-to-画像モデル(DALL-E 2、Midjourney、Stable Diffusion)における under-specified prompts が、ABC model of social cognition に基づく生成顔の人口統計的ステレオタイプを誘発するかどうかを調査する。

ABSTRACT

As text-to-image systems continue to grow in popularity with the general public, questions have arisen about bias and diversity in the generated images. Here, we investigate properties of images generated in response to prompts which are visually under-specified, but contain salient social attributes (e.g., 'a portrait of a threatening person' versus 'a portrait of a friendly person'). Grounding our work in social cognition theory, we find that in many cases, images contain similar demographic biases to those reported in the stereotype literature. However, trends are inconsistent across different models and further investigation is warranted.

研究の動機と目的

  • プロンプトに明示的な人口統計的詳細が欠けている場合のテキスト-to-画像出力における偏りと多様性の検討を動機づける。
  • 分析を ABC Model of social cognition(Agency、Beliefs、Communion)に基づいて地固めし、プロンプトを人口統計的推論へ対応づける。
  • 三つの人気モデルが ABC の次元から導かれる特性に対してステレオタイプ的な人口統計を再現するかを評価する。
  • 生成画像の知覚人口統計を注釈する際の注釈者間の信頼性と曖昧性処理を評価する。
  • モデル設計と推論および訓練段階での偏り緩和戦略の潜在的影響を論じる。

提案手法

  • 『portrait of a <adjective> person』形式のプロンプトを用いて、三つのモデル(DALL-E 2、Midjourney、Stable Diffusion)で画像を生成する。
  • ABC 特性(高Agency、低Agency、Beliefs、Communion)を含むプロンプトに適用し、各特性極で複数画像を生成してバイアスを評価する。
  • 生成画像を、性別、肌の色、年齢について三名の注釈者が知覚するものとして注釈し、注釈を平均して人口統計スコアを得る。
  • Cohen's Kappa による注釈者間合意を分析し、モデル間で報告する。
  • 曖昧さ(AIAO)と多様性(AIDO)戦略を検討し、曖昧な手がかりを含む画像の割合を報告する。

実験結果

リサーチクエスチョン

  • RQ1過不足のある社会的特徴のプロンプトを用いた場合、テキスト-to-画像モデルは人口統計的偏りを再現するか?
  • RQ2異なるモデル(DALL-E 2、Midjourney、Stable Diffusion)は ABC-model プロンプトに対して、性別、肌の色、年齢の傾向でどのように異なるか?
  • RQ3モデル間で、肌の色が濃い男性に悪影響が及ぶなど、交差的な偏りが観測されるか?
  • RQ4出力の偏りを形成する過不足、曖昧さ、プロンプト設計の役割は何か?
  • RQ5これらの偏りがデバイアス手法とモデル設計に与える示唆は何か?

主な発見

  • ABC 次元に沿ったモデルの特異的な偏りが見られる。すべての特性がステレオタイプ的な画像を生み出すわけではないが、モデルごとにパターンが存在する。
  • Midjourney と Stable Diffusion は肌の色が淡く、被写体が若い傾向を示す。一方、DALL-E は基準で男性の過剰表象を示す。
  • 高い Agency のプロンプトは一部のモデルで男性性へ、高い Communion は女性の外観へ偏らせる傾向がある一方、低い Communion は別のモデルで男性性への偏りを示す。
  • Progressive beliefs は Midjourney では肌の色が明るくなる傾向と関連することが多い。DALL-E および Stable Diffusion では、低い Communion に肌の色が淡くなる場合がある。
  • Intersectional analysis は、肌が濃い男性が“poor”という形容詞と関連づけられる傾向を全モデルで示し、濃い色の女性は過小評価されることが多い。
  • 曖昧性処理(AIAO)は一部で明示的な人口統計的手掛かりを減少させるが、主分析の焦点ではない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。