[논문 리뷰] Gender Bias in Multimodal Models: A Transnational Feminist Approach Considering Geographical Region and Culture
이 논문은 CLIP와 같은 다중모odal 모델의 성별 편향을 심층적으로 감시하기 위해 전지구적 지역과 문화적 배경을 통합한 이질적 페미니즘 프레임워크를 제안한다. 글로벌 지역 간 코사인 유사도 점수를 사용하여, 사회적 성별 불평등(글로벌 성별 격차 지수로 측정)과 모델 편향 간 강한 상관관계를 발견하였으며, 특히 여성의 점잖은 복장이 '테러리즘'과 연관지어지는 등 제3세계 지역에서 더 뚜렷한 성별 고정관념이 나타났다.
Deep learning based visual-linguistic multimodal models such as Contrastive Language Image Pre-training (CLIP) have become increasingly popular recently and are used within text-to-image generative models such as DALL-E and Stable Diffusion. However, gender and other social biases have been uncovered in these models, and this has the potential to be amplified and perpetuated through AI systems. In this paper, we present a methodology for auditing multimodal models that consider gender, informed by concepts from transnational feminism, including regional and cultural dimensions. Focusing on CLIP, we found evidence of significant gender bias with varying patterns across global regions. Harmful stereotypical associations were also uncovered related to visual cultural cues and labels such as terrorism. Levels of gender bias uncovered within CLIP for different regions aligned with global indices of societal gender equality, with those from the Global South reflecting the highest levels of gender bias.
연구 동기 및 목표
- 다양한 지리적 지역과 문화적 맥락에서 CLIP와 같은 다중모달 모델의 성별 편향이 어떻게 다양하게 나타나는지 조사하기 위해.
- 서유럽 중심의 프레임워크를 넘어서 상호작용적 성별 편향을 분석하기 위해 전지구적 페미니즘 이론을 적용하기 위해.
- 사회 수준의 성별 불평등이 다중모달 임bedding에서의 모델 수준의 성별 편향과 측정 가능한 상관관계를 가지는지 평가하기 위해.
- 문화적 시각적 신호(예: 히잡, 의복 등)가 모델 예측에서 고정관념적 연관성에 어떻게 기여하는지 밝혀내기 위해.
- 영어 기반 인터넷 자료에서 유래한 훈련 데이터의 편향이 성별 및 지역에 대한 고정관념 형성에 어떤 영향을 미치는지 평가하기 위해.
제안 방법
- 다양한 지리적 지역에서 온 남성과 여성의 이미지로 구성된 전지구적 데이터셋을 구축하였으며, 특히 문화적 다양성과 지역적 다양성을 중시하였다.
- CLIP의 텍스트 및 이미지 인코더를 사용하여, 지역 및 성별에 따라 텍스트적 성별 기술어(형용사, 직업 등)와 이미지 임베딩 간 코사인 유사도를 계산하였다.
- Grad-CAM 시각화를 적용하여, 예측에 가장 큰 기여를 하는 이미지 영역(예: 히잡 등)을 특정하였으며, 특히 여성의 머리 가리개 착용이 '테러리스트'와 연관지어지는 경우를 확인하였다.
- 지역별 성별 차이 점수(남성어와 여성어에 대한 유사도 차이)를 글로벌 성별 격차 지수(GGI)와 상관관계 분석하였다.
- 형용사(예: '돌봄', '우아함')와 직업(예: '산부인과 간호사', '건축가')를 지역별로 분석하여 성별 편향 패턴을 탐지하였다.
- 피어슨 상관계수를 사용한 통계 분석을 통해 GGI 점수와 모델 편향 지표 간의 관계를 검증하였으며, r값과 p값을 보고하였다.

실험 결과
연구 질문
- RQ1CLIP의 성별 편향은 다양한 지리적 지역과 문화적 맥락에서 어떻게 변화하는가?
- RQ2의복과 같은 문화적 시각적 신호가 다중모달 모델의 예측에서 고정관념적 연관성에 얼마나 영향을 미치는가?
- RQ3글로벌 성별 격차 지수(GGI)에 따라 측정된 사회 수준의 성별 평등과 CLIP 임베딩에서 관찰된 성별 편향 정도 사이에 측정 가능한 상관관계가 존재하는가?
- RQ4지역별 성별 직업 및 형용사 표현이 기존 사회적 고정관념을 어떻게 반영하거나 강화하는가?
- RQ5모델의 편향이 주로 영어 기반 인터넷 자료에서 유래한 훈련 데이터에 의해 얼마나 영향을 받는가?
주요 결과
- 형용사에 대한 성별 차이 점수와 글로벌 성별 격차 지수(GGI) 사이에 강한 음의 상관관계(r = -0.84, p = 0.003)를 발견하여, 성별 불평등이 낮은 지역일수록 더 높은 편향이 있음을 시사하였다.
- 남아시아, 서아시아, 북아프리카 지역에서 형용사 연관성에서 가장 높은 성별 편향을 보였으며, 특히 여성과 '돌봄', '우아함', '섬세함'을 연결지어 표현하였다.
- 직업에 대해서는 동아시아 및 남동아시아의 여성 이미지가 '산부인과 간호사', '가정부', '도서관사'와 가장 높은 유사도를 보였으며, 지역적 성별 역할 고정관념을 반영하였다.
- 히잡을 착용한 여성의 이미지는 CLIP 예측에서 '테러리스트'와 더 강하게 연관되었으며, 머리 가리개 영역을 강조하는 Grad-CAM 주의도 맵으로 확인되었다.
- 직업에 대한 GGI와 성별 편향 간 상관계수도 유의미했음(r = -0.78, p = 0.0012)으로, 사회적 불평등과 모델 편향 간의 연관성을 더욱 공고히 하였다.
- 유럽, 북미, 동아시아 지역은 성별 차이 점수가 가장 낮고, 글로벌 성별 격차 지수에서 높은 순위를 차지하여, 더 성평등한 사회에서 모델 편향이 적다는 것을 시사하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.