Skip to main content
QUICK REVIEW

[논문 리뷰] Assessing Multilingual Fairness in Pre-trained Multimodal Representations

Jialu Wang, Yang Liu|arXiv (Cornell University)|2021. 06. 12.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 CLIP과 같은 사전 훈련된 다중모odal 모델의 다국어 평가를 위해 다국어 개인 및 집단 공정성 지표를 도입한다. 연구 결과, 의미적 유사성은 언어 간에 유지되나(개인 공정성), 특히 저자원 언어에서 심각한 정확도 격차가 존재하여 인종, 성별, 연령 집단 간 편향된 예측을 초래함을 확인하였다. 이는 다국어 다중모달 AI에서의 근본적인 공정성 격차를 드러낸다.

ABSTRACT

Recently pre-trained multimodal models, such as CLIP, have shown exceptional capabilities towards connecting images and natural language. The textual representations in English can be desirably transferred to multilingualism and support downstream multimodal tasks for different languages. Nevertheless, the principle of multilingual fairness is rarely scrutinized: do multilingual multimodal models treat languages equally? Are their performances biased towards particular languages? To answer these questions, we view language as the fairness recipient and introduce two new fairness notions, multilingual individual fairness and multilingual group fairness, for pre-trained multimodal models. Multilingual individual fairness requires that text snippets expressing similar semantics in different languages connect similarly to images, while multilingual group fairness requires equalized predictive performance across languages. We characterize the extent to which pre-trained multilingual vision-and-language representations are individually fair across languages. However, extensive experiments demonstrate that multilingual representations do not satisfy group fairness: (1) there is a severe multilingual accuracy disparity issue; (2) the errors exhibit biases across languages conditioning the group of people in the images, including race, gender and age.

연구 동기 및 목표

  • 사전 훈련된 다국어 다중모달 모델이 공정성 측면에서 모든 언어를 동일하게 취급하는지 조사하기 위해.
  • 다국어 다중모달 표현 학습 분야에서 체계적인 공정성 평가의 부재를 해결하기 위해.
  • 시각적 기반을 기준으로 하여 다국어 다중모달 환경에서의 공정성 개념—개인 및 집단 공정성—을 체계화하기 위해.
  • 다국어 모델이 언어 및 교차적 인구 통계 집단 간에 심각한 정확도 격차를 보임을 경험적으로 입증하기 위해.
  • 시각적 표현 선택이 집단 공정성 지표에 미치는 영향을 부각하여, 후속 응용에서 주의가 필요함을 경고하기 위해.

제안 방법

  • 다국어 개인 공정성은 서로 다른 언어에서 의미적으로 동일한 텍스트 스니펫이 동일한 이미지에 동일하게 연결되어야 한다고 정의한다.
  • 다국어 집단 공정성은 최종 작업에서 모든 언어 간에 동일한 예측 성능을 가져야 한다고 정의한다.
  • 이미지와 다국어 텍스트를 공유 임베딩 공간에 인코딩하여 유사도 계산을 위한 CLIP을 기반 모델로 사용한다.
  • FairFace 데이터셋을 활용하여 인간이 애너테이션한 속성(인종, 성별, 연령)을 기반으로 언어 및 인구 통계 차원에서 집단 공정성을 평가한다.
  • 언어적 편향을 의미적 변동에서 분리하기 위해, 모든 언어에서 동일한 숫자 연령 값을 가진 중립적이고 기술적인 텍스트 프롬프트를 구성한다.
  • 이미지 및 텍스트 임베딩 간의 코사인 유사도를 측정하여 모델의 정렬 및 공정성 수준을 평가한다.

실험 결과

연구 질문

  • RQ1의미적으로 동일한 텍스트가 서로 다른 언어에서 제공될 때, 사전 훈련된 다국어 다중모달 모델이 동일한 이미지 정렬을 유도하는 정도는 어느 정도인가?
  • RQ2다국어 집단 공정성이 유지되는가? 즉, 최종 작업에서 모든 언어에서 동일한 성능을 보이는가?
  • RQ3보호된 속성(인종, 성별, 연령)을 기반으로 평가할 때, 정확도 격차는 언어 간에 어떻게 변화하는가?
  • RQ4시각적 표현 선택이 다국어 환경에서 집단 공정성 지표에 어느 정도 영향을 미치는가?
  • RQ5모든 언어에서 동일한 숫자 연령 값을 가질 때조차도 연령 분류에 심각한 횡단적 언어 격차가 존재하는가?

주요 결과

  • 다국어 개인 공정성은 대부분 충족되며, 서로 다른 언어에서 의미적으로 동일한 텍스트가 동일한 이미지에 일관되게 연결됨을 확인하였다.
  • 심각한 다국어 정확도 격차가 존재한다: 영어에서 유아 연령 분류 정확도는 5.8%였지만, 독일어에서는 89.4%, 일본어에서는 91.6%였다.
  • 연령 분류에서 다국어 성별 격차가 심각하게 나타났으며, 다양한 언어에서 남성과 여성 집단 간에 격차가 존재하였다.
  • 모델은 독일어나 일본어와 같은 고자원 언어에 대해 강한 편향을 보였고, 일부 인구 통계 범주에서 프랑스어와 같은 저자원 언어에서는 성능이 열등하였다.
  • 집단 공정성 지표는 시각적 표현 선택에 민감함을 확인하여, 모델 설계 선택이 공정성 결과에 영향을 미칠 수 있음을 시사하였다.
  • 모든 언어에서 동일한 숫자 연령 값을 가진 텍스트 프롬프트를 사용했음에도 정확도가 상당히 다름을 확인하여, 모델 내부에 언어적 및 문화적 인코딩 편향이 존재함을 시사하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.