[論文レビュー] Do Generative AI Models Output Harm while Representing Non-Western Cultures: Evidence from A Community-Centered Approach
本研究は、テキストから画像を生成するAIモデルが非西洋文化、特にインドの文化的な背景をどのように歪めて表現しているかを、コミュニティ中心の視点から調査する。5つのフォーカスグループを対象としたグランド理論分析を通じて、文化的な過剰表現(エキゾチシズム)と文化的盗用(文化的な誤用)という、新たな表現的害悪を同定した。AI出力における構造的バイアスを強調し、グローバルなAI開発における文化的正確性と包摂性を促進する社会技術的デザイン指針を提言する。
Our research investigates the impact of Generative Artificial Intelligence (GAI) models, specifically text-to-image generators (T2Is), on the representation of non-Western cultures, with a focus on Indian contexts. Despite the transformative potential of T2Is in content creation, concerns have arisen regarding biases that may lead to misrepresentations and marginalizations. Through a community-centered approach and grounded theory analysis of 5 focus groups from diverse Indian subcultures, we explore how T2I outputs to English prompts depict Indian culture and its subcultures, uncovering novel representational harms such as exoticism and cultural misappropriation. These findings highlight the urgent need for inclusive and culturally sensitive T2I systems. We propose design guidelines informed by a sociotechnical perspective, aiming to address these issues and contribute to the development of more equitable and representative GAI technologies globally. Our work also underscores the necessity of adopting a community-centered approach to comprehend the sociotechnical dynamics of these models, complementing existing work in this space while identifying and addressing the potential negative repercussions and harms that may arise when these models are deployed on a global scale.
研究の動機と目的
- テキストから画像への変換(T2I)モデルが、特に非西洋的文脈において、インドの文化およびそのサブカルチャーをどのように表現しているかを調査すること。
- 多様なインドのコミュニティを不当に排除または誤解を招く形で表現する、AI生成コンテンツにおける新たな形の表現的害悪を明らかにすること。
- より公平で正確なT2Iシステムを実現するため、文化的に根ざした、コミュニティに根ざしたデザイン原則を策定すること。
- AI倫理における西洋中心の枠組みの優位性に挑戦し、グローバル・サウスの弱い立場にある声を核とする。
- 文化的知識とコミュニティの主体性をモデル開発に統合する社会技術的かつ包括的なAI設計のあり方を提唱すること。
提案手法
- インドの多様なサブカルチャーや地域に属する25名の参加者を対象に、5つのコミュニティベースのフォーカスグループを実施し、文化的に特化したプロンプトに対するT2I出力の分析を実施した。
- グランド理論分析(Charmaz, 2017)を用いて、AI生成画像における表現的害悪のパターンを体系的に同定・分類した。
- 参加者が選んだ英語のプロンプトに応じて、Stable Diffusionモデルからリアルタイムで生成された出力を用いて、視覚的表現を分析した。
- 視覚的および物語的コンテンツの主題的コーディングに基づき、エキゾチシズムと文化的盗用という2つの新しい表現的害悪の定義と操作的定義を提示した。
- コミュニティ参加者および文化的専門家の知見を統合した社会技術的視点から、デザイン指針を策定した。
- 研究資料をGitHubリポジトリに公開することで、透明性と再現可能性を確保した。
実験結果
リサーチクエスチョン
- RQ1T2I出力は、インドの文化およびそのサブカルチャーをどのように表現しており、多様な文化的グループにどのような影響を及えるか?
- RQ2T2Iシステムとインドの文化的文脈との相互作用から、どのような新たな形の表現的害悪が生じるか?
- RQ3コミュニティ中心のデザイン原則は、これらの害悪をどのように軽減し、生成的AIシステムにおける文化的正確性を向上させることができるか?
- RQ4非エキゾチックで正確な表現を意図しても、なぜ文化的に適切な出力が得られないのか?
- RQ5表面的な文化的な兆候は、ユーザーの意図とは裏腹に、なぜ誤った表現を助長するのか?
主な発見
- T2Iモデルは、インドの文化を一貫してエキゾチックに描写しており、農村風景の過剰表現、すべての女性形像にサリーを着用させること、市場や日常の生活を過剰にカラフルに描写するといった特徴が見られる。
- ユーザーがステレオタイプ的なイメージを避けるためにプロンプトを洗練させても、エキゾチシズムが継続していることから、モデルの学習データおよび生成ロジックに構造的バイアスが存在することが示された。
- 文化的盗用が広く見られる。具体的には、地方の朝食アイテムの誤った融合、地方の衣装の着け方の誤解、伝統的ダンスの装飾品の誤った使用が含まれる。
- 参加者らは、こうした誤解表現が、特に目立たないサブカルチャーや地方的アイデンティティの文化的消滅や疎外を引き起こしていると報告した。
- T2Iモデルには文化的な文脈を的確に理解する能力が欠如しており、文化的特徴を文脈に根ざした実践ではなく、単体のステレオタイプ的象徴として扱っていることが明らかになった。
- ユーザーが正確な表現を意図しても、モデルは文化的に適切な出力を提供できないことが判明し、コミュニティに根ざしたデータと設計の必要性が強く示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。