Skip to main content
QUICK REVIEW

[論文レビュー] How well can Text-to-Image Generative Models understand Ethical Natural Language Interventions?

Hritik Bansal, Da Yin|arXiv (Cornell University)|Oct 27, 2022
Computational and Text Analysis Methods被引用数 7
ひとこと要約

本稿では、性別、肌の色、文化的背景の公平な表現を促す倫理的自然言語介入に対するテキスト対画像生成モデルの反応を評価するためのベンチマークであるENTIGENを紹介する。'性別にかかわらず'のような介入は、特に性別および文化的バイアスにおいて、画像品質を損なうことなく多様性を著しく向上させることを示しており、言語的キューによってモデルを公平性へと誘導できる可能性を示唆している。

ABSTRACT

Text-to-image generative models have achieved unprecedented success in generating high-quality images based on natural language descriptions. However, it is shown that these models tend to favor specific social groups when prompted with neutral text descriptions (e.g., 'a photo of a lawyer'). Following Zhao et al. (2021), we study the effect on the diversity of the generated images when adding ethical intervention that supports equitable judgment (e.g., 'if all individuals can be a lawyer irrespective of their gender') in the input prompts. To this end, we introduce an Ethical NaTural Language Interventions in Text-to-Image GENeration (ENTIGEN) benchmark dataset to evaluate the change in image generations conditional on ethical interventions across three social axes -- gender, skin color, and culture. Through ENTIGEN framework, we find that the generations from minDALL.E, DALL.E-mini and Stable Diffusion cover diverse social groups while preserving the image quality. Preliminary studies indicate that a large change in the model predictions is triggered by certain phrases such as 'irrespective of gender' in the context of gender bias in the ethical interventions. We release code and annotated data at https://github.com/Hritikbansal/entigen_emnlp.

研究の動機と目的

  • 倫理的自然言語介入がテキスト対画像生成モデルにおける社会的バイアスを低減できるかどうかを調査すること。
  • このような介入が性別、肌の色、文化的表現の各側面におけるモデル出力に与える影響を評価すること。
  • 倫理的介入をプロンプトに追加した際のバイアスの変化を測定するための標準化されたベンチマーク(ENTIGEN)を構築すること。
  • 公平な画像生成に向かうモデル行動の変化を引き起こす最も顕著なフレーズを特定すること。
  • 人間とCLIPベースの評価の信頼性および限界を、バイアス低減の測定において評価すること。

提案手法

  • 性別、肌の色、文化的背景の3つのバイアス軸にわたる中立的プロンプトを用意し、倫理的介入を付加することでENTIGENベンチマークを構築した。
  • CLIPと人間のアノテーター(MTurkを介して)を用いて、生成された画像を社会的グループ(例:男性/女性、肌の色が薄い/濃い、西洋/非西洋)に分類した。
  • minDALL·E、DALL·E-mini、Stable Diffusionの3つのオープンソースモデルが倫理的介入にどのように反応するかを評価した。
  • 視覚的ヒントを含まない道徳的指針を提供する倫理的介入を設計した(例:'性別にかかわらず')。これにより、特定のグループの明示的表現を避けることができた。
  • CLIP埋め込みを用いた自動評価と、適正な報酬(時給10ドル)を支払った手動アノテーションを実施し、グループの表現割合を評価した。
  • キーフレーズ(例:'性別にかかわらず'、'文化')がモデル行動に大きな変化を引き起こす背景として、事前学習データにおけるそのフレーズの使用状況を分析した。

実験結果

リサーチクエスチョン

  • RQ1倫理的自然言語介入は、テキスト対画像モデルにおける性別、肌の色、文化的背景の各側面における画像生成の多様性にどのように影響を与えるか?
  • RQ2倫理的介入に含まれるどの具体的なフレーズが、公平な表現に向かうモデル行動に最も強く影響を与えるか?
  • RQ3微調整なしに、既存のテキスト対画像モデルが倫理的介入を提示された際にどれほど多様な出力を生成できるか?
  • RQ4CLIPと人間のアノテーターは、生成画像における社会的グループ表現の変化をどれほど信頼性を持って検出できるか?
  • RQ5キーフレーズ(例:'性別にかかわらず')が事前学習データ内でどのような文脈に置かれていたかが、モデル反応に与える役割は何か?

主な発見

  • 性別にかかわらず'などの倫理的介入は、特に性別バイアスの状況において、代表されていなかったグループの画像内での表現を顕著に増加させた。
  • '性別にかかわらず'というフレーズは、モデル行動に大きなシフトを引き起こし、生成画像における性別のバランスを向上させた。
  • Stable Diffusion、minDALL·E、DALL·E-miniのすべてが、倫理的介入を提示された場合に多様な出力を生成し、高い画像品質を維持した。
  • 一部のケースでは、倫理的介入によりバイアスが逆転し、元々代表が不足していたグループが優遇されるようになった。これは、前もって公平性を是正する可能性を示している。
  • '性別にかかわらず'や'文化'といったキーフレーズの事前学習データにおける文脈が、モデル出力の変化に与える効果と相関していた。
  • 人間とCLIPベースの評価は一貫した傾向を示したが、両者ともグループ分類において知覚的および文化的な限界を有していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。