[論文レビュー] Uncurated Image-Text Datasets: Shedding Light on Demographic Bias
本稿では、Google Conceptual Captionsデータセット(GCC)の新規にアノテートされたサブセット、PHASEを紹介する。PHASEは、年齢、性別、肌色、民族的背景、感情、行動といった文化的文脈的属性(感情、活動)を含む。本研究は、未加工の視覚・言語データセットにおける社会的バイアスを調査することを目的としている。結果として、特に性別と肌色において顕著なデモグラフィックな不均衡が、画像・テキストペア全体にわたって確認され、画像キャプション、CLIP埋め込み、テキストから画像生成といった下流タスクにおいてもバイアスが継続していることが示された。モデルは、女性や肌の色が濃い人々を体系的に過小表現している。
The increasing tendency to collect large and uncurated datasets to train vision-and-language models has raised concerns about fair representations. It is known that even small but manually annotated datasets, such as MSCOCO, are affected by societal bias. This problem, far from being solved, may be getting worse with data crawled from the Internet without much control. In addition, the lack of tools to analyze societal bias in big collections of images makes addressing the problem extremely challenging. Our first contribution is to annotate part of the Google Conceptual Captions dataset, widely used for training vision-and-language models, with four demographic and two contextual attributes. Our second contribution is to conduct a comprehensive analysis of the annotations, focusing on how different demographic groups are represented. Our last contribution lies in evaluating three prevailing vision-and-language tasks: image captioning, text-image CLIP embeddings, and text-to-image generation, showing that societal bias is a persistent problem in all of them.
研究の動機と目的
- Google Conceptual Captions (GCC) のような大規模かつ未加工の視覚・言語データセットにおけるデモグラフィックアノテーションの不足を是正すること。
- GCCにおける性別、肌色、民族的背景、年齢、感情、行動といった主要なデモグラフィック属性における表現の不均衡を分析すること。
- 社会的バイアスが、画像キャプション、テキスト・イメージのCLIP埋め込み、テキストから画像生成といった主な視覚・言語タスクに残存するかどうかを評価すること。
- 視覚・言語モデルにおけるバイアスの検出および是正のための、公開可能で人手によるアノテーション済みベンチマークを提供すること。
提案手法
- GCCの18,889枚の画像・領域ペアに対して、年齢、性別、肌色、民族的背景、感情、行動の6つの属性についてクラウドソーシングによるアノテーションを実施。
- PHASEデータセットの作成。バイアス分析を目的とした、標準化され、人間が認識するデモグラフィックラベルを有するGCCのキュレートされたサブセット。
- GCCデータセット全体におけるデモグラフィック分布の包括的統計分析。MSCOCOなどの手動アノテーション済みデータセットと比較。
- 3つの視覚・言語タスクの評価:(1) ファインチューニングされたモデルを用いた画像キャプション生成、(2) CLIP埋め込みの類似度、(3) Stable Diffusionを用いたテキストから画像生成。
- NSFW出力を検出するためのセーフティチェッカー・モジュールの使用。オリジナル画像と生成画像の間でのデモグラフィック分布を比較。
- 生成画像100枚の手動検証。テキストから画像生成におけるデモグラフィックバイアスの評価。

実験結果
リサーチクエスチョン
- RQ1GCCのような大規模で未加工の画像・テキストデータセットにおいて、手動アノテーション済みデータセットと比較して、性別や肌色といったデモグラフィック属性の不均衡はどの程度顕著か?
- RQ2視覚・言語モデルが、画像キャプション、CLIP埋め込み類似度、テキストから画像生成において、デモグラフィックグループごとに性能の差を示す程度はどの程度か?
- RQ3Stable Diffusionのようなテキストから画像生成モデルにおけるセーフティチェッカーは、性別や肌色に基づいて画像をフィルタリングする際にバイアスを示すか?
- RQ4生成画像における認識されたデモグラフィック属性は、元のトレーニングデータにおけるそれとどのように比較されるか?
- RQ5PHASEデータセットは、視覚・言語モデルにおける社会的バイアスの検出および是正のための信頼できるベンチマークとして機能できるか?
主な発見
- GCCデータセットは顕著なデモグラフィック不均衡を示しており、男性が64.96%、女性が35.04%を占めており、肌色が明るい人々は73.4%を占めている。
- MSCOCOと比較すると、GCCは性別(男性64.96% 対 女性35.04%)および肌色(明るい73.4% 対 濃い26.6%)においてより大きな表現格差を示している。
- テキストから画像生成において、生成画像の47.4%が男性、35.5%が女性を表しており、肌色が明るい画像は54.0%、濃いのは26.6%である。これは、女性および肌色が濃い人々の体系的過小表現を示している。
- Stable Diffusionのセーフティチェッカーは、女性に関連するプロンプトから生成されたとされる不適切な出力を51.61%がフィルタリングしたが、これは女性が元の画像で35.04%に過ぎないことを考慮すると、検出に性別バイアスが存在する可能性を示唆している。
- 中立的な言語(例:「person」)が使われたプロンプトでは、モデルは主に白人男性の画像を生成していた。これは、デフォルトの生成行動に強いバイアスが存在することを示している。
- 本研究は、社会的バイアスがトレーニングデータに存在するだけでなく、キャプション生成、埋め込み、生成といった下流タスクにおいても強化されることを確認した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。