[論文レビュー] Vision-Language Models Performing Zero-Shot Tasks Exhibit Gender-based Disparities
本研究は、画像分類、物体検出、セマンティックセグメンテーションの各タスクにおいて、ゼロショット視覚言語モデル(CLIP、Detic、LSeg)の性別に基づく性能差を調査する。モデルの正確性とキャリブレーションは、画像内の人物の認識される性別によって顕著に変動し、事前学習された単語埋め込みのバイアスと類似した傾向を示す。これは、オープンボックス視覚システムにおけるバイアスの伝搬リスクを浮き彫りにする。
We explore the extent to which zero-shot vision-language models exhibit gender bias for different vision tasks. Vision models traditionally required task-specific labels for representing concepts, as well as finetuning; zero-shot models like CLIP instead perform tasks with an open-vocabulary, meaning they do not need a fixed set of labels, by using text embeddings to represent concepts. With these capabilities in mind, we ask: Do vision-language models exhibit gender bias when performing zero-shot image classification, object detection and semantic segmentation? We evaluate different vision-language models with multiple datasets across a set of concepts and find (i) all models evaluated show distinct performance differences based on the perceived gender of the person co-occurring with a given concept in the image and that aggregating analyses over all concepts can mask these concerns; (ii) model calibration (i.e. the relationship between accuracy and confidence) also differs distinctly by perceived gender, even when evaluating on similar representations of concepts; and (iii) these observed disparities align with existing gender biases in word embeddings from language models. These findings suggest that, while language greatly expands the capability of vision tasks, it can also contribute to social biases in zero-shot vision settings. Furthermore, biases can further propagate when foundational models like CLIP are used by other models to enable zero-shot capabilities.
研究の動機と目的
- ゼロショット視覚言語モデルが、多様な視覚タスクにおいて性別に基づく性能差を示すかどうかを調査すること。
- 画像に共起する人物の認識される性別ごとに、期待キャリブレーション誤差(ECE)で測定されるモデルキャリブレーションの違いを検討すること。
- 観察された視覚モデルの差が、事前学習された単語埋め込みに既存する性別バイアスと一致するかどうかを特定すること。
- CLIPのような基盤モデルが、下流モデルにおけるゼロショット機能を可能にする際に、バイアスの伝搬リスクを評価すること。
- すべてのコンセプトの性能を集約することで、顕著な性別差が隠蔽される可能性があることを示し、個別コンセプト評価の重要性を強調すること。
提案手法
- Visual Genome を含む複数のデータセット上で、CLIP(ViT-B/32)、Detic(物体検出用)、LSeg(セマンティックセグメンテーション用)の3つのゼロショットモデルを評価した。
- タスク固有のファインチューニングなしに、言語モデルのテキスト埋め込みを分類器として用い、ゼロショット画像分類、検出、セグメンテーションを実施した。
- 人物の認識される性別を、データセットからの二値化されたアノテーションに基づき定義した。これは自己認識ではなく、視覚的認識に依存する。
- 平均適合度(AP)と期待キャリブレーション誤差(ECE)を用いて、認識される性別グループごとの正確性と自信の整合性を評価し、性能差を測定した。
- 各コンセプトごとの差をマッピングし、オブジェクトの顕著性(例:髪、ネクタイ)の違いや、性別グループ間でのコンセプト共起パターンの違いといった、根本的原因を特定した。
- 視覚モデルのバイアスを、非文脈的単語埋め込み(例:word2vec からのもの)における性別バイアスと比較することで、整合性と伝搬の程度を評価した。
実験結果
リサーチクエスチョン
- RQ1ゼロショット視覚言語モデルは、視覚的コンセプトと共起する人物の認識される性別に基づいて、性能差を示すか?
- RQ2同じ視覚的コンセプトに対して、認識される性別グループごとに、自信と正確性の関係(特に期待キャリブレーション誤差)はどのように異なるか?
- RQ3事前学習された単語埋め込みにおける性別バイアスが、ゼロショット視覚言語モデルで観察されるバイアスとどの程度相関しているか?
- RQ4すべてのコンセプトの性能を集約することで、個々のコンセプト認識における顕著な性別差が隠蔽されてしまうか?
- RQ5特にコンセプトレベルの認識と共起パターンの違いに起因する、ゼロショット視覚モデルにおける性別バイアスの根本的要因は何か?
主な発見
- 評価されたすべてのモデル(CLIP、Detic、LSeg)は、特定の視覚的コンセプトと共起する人物の認識される性別によって、顕著な性能差を示しており、多くの場合、男性の画像で高い平均適合度を示した。
- すべてのコンセプトにわたる差の分析を集約することで、顕著な性別バイアスが隠蔽されることが判明し、個別コンセプト評価の必要性が強調された。
- 期待キャリブレーション誤差(ECE)で測定されるモデルキャリブレーションは、認識される性別によって顕著に異なる。これは、同じコンセプトを表す場合でも、特定の性別グループに対してモデルが自信がなく、正確性も低いことを示している。
- 視覚モデルにおける性別バイアスは、非文脈的単語埋め込みに既存する性別バイアスと強く一致しており、言語モデルのバイアスが視覚タスクに伝搬されている可能性を示唆している。
- 根本的要因の分析から、オブジェクトの顕著性(例:髪、ネクタイ)の違いや、性別グループ間でのコンセプト共起パターンの違いが、性能差の要因となっていることが明らかになった。
- 本研究の結果は、視覚タスクにおける言語モデルの監視としての使用が、社会的バイアスを伝搬または甚至は強化する可能性があることを示しており、特にCLIPのような基盤モデルが下流システムで再利用される場合に顕著である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。