[論文レビュー] Discovering and Mitigating Visual Biases through Keyword Explanation
本論文では、画像キャプションからの言語解釈を用いて視覚的バイアスを同定・緩和するためのBias-to-Text (B2T) フレームワークを紹介する。誤って予測された画像や生成された画像のキャプションにおけるキーワードを分析し、CLIPおよびSDスコア関数を適用することで、'プレーヤー'と'女性'や、'ステトスコープ'と'看護師'といった誤った相関関係を特定し、Waterbirdsデータセットでは最悪グループの正確性を11%向上させるとともに、テキスト-to-画像モデルにおける不正または危険な生成を低減する。
Addressing biases in computer vision models is crucial for real-world AI deployments. However, mitigating visual biases is challenging due to their unexplainable nature, often identified indirectly through visualization or sample statistics, which necessitates additional human supervision for interpretation. To tackle this issue, we propose the Bias-to-Text (B2T) framework, which interprets visual biases as keywords. Specifically, we extract common keywords from the captions of mispredicted images to identify potential biases in the model. We then validate these keywords by measuring their similarity to the mispredicted images using a vision-language scoring model. The keyword explanation form of visual bias offers several advantages, such as a clear group naming for bias discovery and a natural extension for debiasing using these group names. Our experiments demonstrate that B2T can identify known biases, such as gender bias in CelebA, background bias in Waterbirds, and distribution shifts in ImageNet-R/C. Additionally, B2T uncovers novel biases in larger datasets, such as Dollar Street and ImageNet. For example, we discovered a contextual bias between "bee" and "flower" in ImageNet. We also highlight various applications of B2T keywords, including debiased training, CLIP prompting, and model comparison.
研究の動機と目的
- 事前に定義されたバイアスカテゴリに依存せずに、視覚モデルにおける未知の視覚的バイアスを診断・緩和する課題に対処すること。
- 画像から自然言語の記述を生成し、共通キーワードを抽出することで、説明可能なバイアス同定を可能にすること。
- 画像分類器およびテキスト-to-画像生成モデルの両方に適用可能な汎用的かつモデルに依存しないフレームワークの開発。
- ゼロショット分類器における最悪グループの頑健性を向上させるとともに、拡散モデルにおける不正または危険な画像生成を低減すること。
- 言語ベースの視覚的バイアスパターンの解釈を用いた、実用的でスケーラブルなモデルのバイアス除去手法の提供。
提案手法
- 誤って予測された画像やテキスト条件付きの生成画像など、バイアスの可能性がある画像から自然言語記述を生成するために、事前学習済みキャプションモデル(例:CLIP-Cap)を用いる。
- これらのキャプションから共通キーワードを抽出し、バイアスの予測や生成に関連する繰り返し出現する語を同定する。
- バイアスキーワードと誤って予測された画像との類似度を測定するCLIPスコアを提案し、モデルの失敗と整合性を保証する。
- 元のプロンプトとバイアスキーワードの間の拡散スコアを比較することで、生成画像がバイアスキーワードを反映しているかどうかを検証するSD(Stable Diffusion)スコアを導入する。
- 同定されたキーワードを用いてモデルをバイアス除去する:ゼロショット分類器ではプロンプトを拡張し、テキスト-to-画像モデルでは拡散スコアをガイドする。
- このフレームワークを画像分類およびテキスト-to-画像生成の両タスクにおける誤った相関関係の検出・緩和に適用する。
実験結果
リサーチクエスチョン
- RQ1画像キャプションの言語解釈が、事前に知られていない視覚的バイアスを効果的に同定できるか?
- RQ2CLIPやSDのようなスコア関数を用いることで、キャプション画像からのバイアスキーワードのフィルタリングと検証はどのように可能か?
- RQ3キーワードベースのバイアス除去は、ゼロショット画像分類器における最悪グループの正確性をどの程度向上させられるか?
- RQ4B2Tフレームワークは、性別や露出のバイアスのような、テキスト-to-画像生成における不正または危険な属性を検出・緩和できるか?
- RQ5B2Tフレームワークは、識別的および生成的アーキテクチャを含む、さまざまな視覚モデルに一般化可能か?
主な発見
- B2Tフレームワークは、Kaggle Faceデータセットにおいて、以前に検出されていなかった'プレーヤー'と'女性'の新たな誤った相関関係を同定した。
- B2Tを用いたバイアス除去により、Waterbirdsデータセットにおける最悪グループの正確性がベースライン比で11%向上した。
- テキスト-to-画像モデルでは、'看護師'が'女性'と関連づけられたり、'ステトスコープ'と関連づけられる性別バイアス、および生成画像における'裸'といった危険なバイアスを効果的に検出できた。
- SDスコアは、生成画像における危険または不正な属性を効果的に同定でき、低いスコアはバイアスの強い存在を示していた。
- フレームワークはImageNet-Cやさまざまなテキスト-to-画像プロンプトを含む多様なベンチマークで頑健な性能を示し、一貫したバイアス検出を実現した。
- CLIPおよびSDスコアの使用により、誤検出バイアスキーワードが顕著に減少し、同定されたバイアスの信頼性が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。