[논문 리뷰] Multimodal Composite Association Score: Measuring Gender Bias in Generative Multimodal Models
이 논문은 DALL-E 2와 Stable Diffusion와 같은 생성형 다중모态 모델에서 성별 편향을 측정하기 위해 텍스트 및 이미지 임베딩 간의 연관성을 측정하는 확장 가능한 방법인 다중모달 복합연관점수(MCAS)를 제안한다. MCAS는 두 모델 모두에서 여성에 대한 강한 전연적 성향 연관성을 드러내며, 특히 Stable Diffusion는 DALL-E 2보다 유의미하게 높은 편향 점수를 보인다.
Generative multimodal models based on diffusion models have seen tremendous growth and advances in recent years. Models such as DALL-E and Stable Diffusion have become increasingly popular and successful at creating images from texts, often combining abstract ideas. However, like other deep learning models, they also reflect social biases they inherit from their training data, which is often crawled from the internet. Manually auditing models for biases can be very time and resource consuming and is further complicated by the unbounded and unconstrained nature of inputs these models can take. Research into bias measurement and quantification has generally focused on small single-stage models working on a single modality. Thus the emergence of multistage multimodal models requires a different approach. In this paper, we propose Multimodal Composite Association Score (MCAS) as a new method of measuring gender bias in multimodal generative models. Evaluating both DALL-E 2 and Stable Diffusion using this approach uncovered the presence of gendered associations of concepts embedded within the models. We propose MCAS as an accessible and scalable method of quantifying potential bias for models with different modalities and a range of potential biases.
연구 동기 및 목표
- DALL-E 2와 Stable Diffusion와 같은 복잡하고 다단계인 생성형 모델에 대해 확장 가능한 다중모달 편향 평가 방법의 부족을 해결하기 위해.
- 다중모달 모델 내 텍스트 및 이미지 표현에서의 성별 편향을 탐지하고 정량화하기 위해.
- 모델 구성 요소 간의 편향 원인을 특정화하고, 단계 간 편향 증폭 여부를 파악하기 위해.
- MLOps, 모델 모니터링 및 완화를 지원하는 정량적이고 확장 가능한 메트릭을 제공하기 위해.
제안 방법
- MCAS는 텍스트 및 이미지 임베딩 내 개념 집합 간의 연관성을 측정하기 위해 워드 임베딩 연관성 테스트(WEAT)를 확장한다.
- 물체, 직업, 풍경, 스포츠 등의 다수의 개념 카테고리에서 연관성 강도를 집계하여 복합 점수를 계산한다.
- 편향 패턴을 탐지하기 위해 상호모달 연관성(텍스트-이미지)과 내부모달 연관성(텍스트-텍스트, 이미지-이미지)을 모두 평가한다.
- 성별 개념 집합의 임베딩 클러스터 간 코사인 유사도를 사용하여 구성 요소 점수를 계산하며, 통계적 유의성은 순열 검증을 통해 평가한다.
- 이 방법은 편향이 발생하거나 증폭되는 단계를 분해하여 특정 단계에서 기인하는지 파악할 수 있도록 한다.
- MCAS는 텍스트 및 이미지 이외의 모odal리티와 성별 외의 편향(예: 인종, 민족)에도 확장 가능하도록 설계되어 있다.

실험 결과
연구 질문
- RQ1DALL-E 2와 Stable Diffusion와 같은 생성형 다중모달 모델이 생성하는 출력에서 전연적 성별 연관성이 얼마나 강하게 나타나는가?
- RQ2다중모달 생성에서 관찰된 성별 편향에 가장 기여하는 모델 구성 요소나 단계는 무엇인가?
- RQ3직업과 풍경과 같은 다양한 개념 카테고리에서 이러한 모델의 성별 연관성 강도는 어떻게 비교되는가?
- RQ4MCAS는 Stable Diffusion와 같은 다단계 파이프라인 모델에서 편향 증폭을 탐지하고 정량화할 수 있는가?
- RQ5DALL-E 2와 Stable Diffusion 간 MCAS 점수는 편향의 크기와 분포 측면에서 어떻게 비교되는가?
주요 결과
- Stable Diffusion는 DALL-E 2보다 유의미하게 높은 평균 성별 편향 점수를 보이며, 전체 MCAS 편향 점수는 -0.3025로 DALL-E 2의 -0.0152보다 높다.
- 직업 카테고리에서는 'CEO'는 강한 남성 연관성을 보였고, '주방일당'과 '미용사'는 강한 여성 연관성을 보여 성별 직업 전연적 편향을 확인한다.
- 스포츠 카테고리에서는 남성 연관성이 가장 강했으며, '공연체조'는 유일하게 여성과 강하게 연결된 스포츠였다.
- 물체 카테고리에서는 '블로운'이 여성과 강하게 연관되어 있어 이미지 생성에서 성별에 기반한 신체적 전연적 편향이 있음을 시사한다.
- 편향 점수의 표준편차는 항상 Stable Diffusion에서 더 높았으며, 이는 입력에 따라 편향이 더 변동성이 크고 잠재적으로 증폭될 수 있음을 시사한다.
- MCAS는 편향이 발생할 경우 여성과의 연관성이 남성과의 연관성보다 더 강한 경향이 있음을 드러내어 편향 강도에 성별 비대칭성이 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.