[論文レビュー] Towards Equitable Representation in Text-to-Image Synthesis Models with the Cross-Cultural Understanding Benchmark (CCUB) Dataset
本稿では、文化的な配慮を持つテキスト対画像生成手法を提案する。CCUBデータセット(8つの文化圏から1,095組の選別済み画像・テキストペア)を用い、Stable Diffusionにおけるバイアスおよび不快な表現の低減を図る。CCUBデータでモデルを微調整し、GPT-3を用いて文化的文脈を含むプロンプトを拡張することで、画像品質を維持したまま文化的適合性を向上させ、不快な表現を低減する。
It has been shown that accurate representation in media improves the well-being of the people who consume it. By contrast, inaccurate representations can negatively affect viewers and lead to harmful perceptions of other cultures. To achieve inclusive representation in generated images, we propose a culturally-aware priming approach for text-to-image synthesis using a small but culturally curated dataset that we collected, known here as Cross-Cultural Understanding Benchmark (CCUB) Dataset, to fight the bias prevalent in giant datasets. Our proposed approach is comprised of two fine-tuning techniques: (1) Adding visual context via fine-tuning a pre-trained text-to-image synthesis model, Stable Diffusion, on the CCUB text-image pairs, and (2) Adding semantic context via automated prompt engineering using the fine-tuned large language model, GPT-3, trained on our CCUB culturally-aware text data. CCUB dataset is curated and our approach is evaluated by people who have a personal relationship with that particular culture. Our experiments indicate that priming using both text and image is effective in improving the cultural relevance and decreasing the offensiveness of generated images while maintaining quality.
研究の動機と目的
- 偏った大規模データセットで学習されたテキスト対画像生成モデルにおける文化的表現の不平等な偏りを是正すること。
- 特に文化的にマイノリティの立場にあるグループに対して有害なステレオタイプや不快な表現を低減すること。
- 再訓練を必要とせず、事前学習済みモデルを文化的に適切な画像生成にカスタマイズするスケーラブルな手法を開発すること。
- 文化的適合性と不快な表現の有無を、現地の文化的専門家によるフィードバックを用いて評価することにより、本物らしさを保証すること。
- 今後の研究を支援するため、公開可能なベンチマークデータセット(CCUB)を構築すること。
提案手法
- 8か国からなる8つの文化圏にまたがる1,095組の画像・テキストペアを含む、文化的理解を重視したCCUBデータセットを、現地の文化的専門家が収集して選別した。
- CCUBデータでStable Diffusionモデルを微調整し、文化的に特化した視覚的コンセプトを学習させ、文化的適合性を向上させた。
- CCUBの文化的に配慮されたテキストデータを用いてGPT-3モデルを訓練し、入力プロンプトに地域の習慣、道具、服装などの関連する文化的詳細を自動で追加する。
- 微調整された画像生成とGPT-3によるプロンプト拡張を組み合わせ、視覚的および意味的側面での文化的適合性を向上させた。
- 5か国の72名の現地参加者を対象としたアンケートを用いて、画像品質、文化的適合性、不快な表現の有無を評価した。
- 提案手法の影響を明確にするために、プロンプトに国名を単に追加するベースラインを用いた。
実験結果
リサーチクエスチョン
- RQ1事前学習済みテキスト対画像モデルを、小規模で文化的に選別されたデータセットで微調整することで、生成画像の文化的適合性が向上するか?
- RQ2微調整済み大規模言語モデル(LLM)を用いた自動的プロンプト拡張は、画像品質を損なわせることなく文化的特異性を高められるか?
- RQ3視覚的微調整と意味的プロンプト拡張を組み合わせた手法は、ベースライン手法と比較して不快な表現の低減と文化的適合性の向上にどのように寄与するか?
- RQ4現地の文化的専門家は、AI生成画像の文化的正確性と不快な表現の有無を信頼性を持って評価できるか?
- RQ5データセットにおける国別文化的表現は、現実の文化的多様性および文化的交差性にどの程度一般化可能か?
主な発見
- 視覚的微調整とプロンプト拡張を組み合わせた手法は、ベースラインと比較して文化的適合性が著しく向上し、不快な表現が38%減少した。
- 微調整のみでは文化的適合性が向上し、不快な表現が減少したが、テキスト・画像の整合性に顕著な影響は認められなかった。
- プロンプト拡張のみでは文化的適合性が向上したが、不快な表現の低減には効果がなく、プロンプトと生成内容の不一致により、テキスト・画像の整合性がわずかに低下した。
- 組み合わせ手法は最良のバランスを達成した。文化的適合性を向上させるとともに、テキスト・画像の整合性を維持またはわずかに改善し、不快な表現を低減した。
- 現地の評価者らは、組み合わせ手法で生成された画像を、ベースラインよりより本物らしく、ステレオタイプ的でないと一貫して評価した。
- CCUBデータセットは高い文化的特異性を示し、多様な文化的表現を正確かつ文脈的に適切に反映するようにモデルを誘導するのに有効であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。