[논문 리뷰] See It from My Perspective: How Language Affects Cultural Bias in Image Understanding
이 논문은 최신 시각-언어 모델(VLM)에 내재된 서양 문화적 편향을 진단하며, 객관적이고 주관적인 과제에서 모두 서양 문화의 이미지보다 동양 문화의 이미지에서 성능이 뚜렷하게 열 劣하다는 점을 보여준다. 이 편향은 영어보다 비영어 언어(예: 중국어)의 비율이 낮은 언어 사전 훈련에 기인한다. 반면, 언어 사전 훈련을 더 균형 있게 구성하면 영어로 프롬프팅하더라도 편향이 감소하며, 중국어로 프롬프팅하면 편향이 더욱 줄어들며, 특히 사전 훈련 단계에서 중국어가 잘 반영된 경우 이 효과가 더욱 두드러진다.
Vision-language models (VLMs) can respond to queries about images in many languages. However, beyond language, culture affects how we see things. For example, individuals from Western cultures focus more on the central figure in an image while individuals from East Asian cultures attend more to scene context. In this work, we characterize the Western bias of VLMs in image understanding and investigate the role that language plays in this disparity. We evaluate VLMs across subjective and objective visual tasks with culturally diverse images and annotations. We find that VLMs perform better on the Western split than on the East Asian split of each task. Through controlled experimentation, we trace one source of this bias in image understanding to the lack of diversity in language model construction. While inference in a language nearer to a culture can lead to reductions in bias, we show it is much more effective when that language was well-represented during text-only pre-training. Interestingly, this yields bias reductions even when prompting in English. Our work highlights the importance of richer representation of all languages in building equitable VLMs.
연구 동기 및 목표
- 최신 VLM가 시각적 이해 과제에서 서양과 동양의 시각적 관점 간에 문화적 편향을 보이는지 조사하기.
- 텍스트 전용 사전 훈련에서 언어 분포가 다중모달 이해에서 VLM의 편향에 어떤 영향을 미치는지 규명하기.
- 비영어 언어(예: 중국어)로 프롬프팅하는 것이 VLM의 서양 편향을 줄일 수 있는지 평가하기.
- 문화적 편향 감소에 있어 다국어 사전 훈련과 다국어 프롬프팅의 효과를 비교하기.
- 사전 훈련 단계에서 목표 언어가 잘 반영되었는지 여부에 따라 편향 감소가 더 효과적인지 분석하기.
제안 방법
- 다양한 문화권의 이미지 이해 과제에 대해 문화적으로 다양성이 있는 데이터셋을 서양 및 동양 서브셋으로 분할하여, 여러 개의 오프더쇼프 VLM(예: LLaVA 변종)을 평가한다.
- LLaVA 기반 VLM을 Llama2 및 Baichuan2 LLM을 사용해 영어 전용 또는 영어/중국어 혼합 코퍼스(2T 토큰)로 사전 훈련한 후, CLIP 시각 인코더로 미세조정한다.
- 객체 식별, 질의 응답, 예술 감정 분류의 세 가지 과제에서 서양 및 동양 이미지 서브셋 간 성능 차이를 측정한다.
- 영어 또는 중국어로 프롬프팅하여 언어의 영향이 편향 감소에 어떤 영향을 미치는지 평가하기 위한 제어 실험을 수행한다.
- 히든 표현을 분석하고, 특히 중국어에서 문화적으로 특화된 시각적 연관성을 모델이 내재적으로 얼마나 반영하는지 확인하기 위해 로짓 렌즈 프로빙을 수행한다.
- 단일 언어 및 이중 언어 텍스트 코퍼스로 사전 훈련한 모델의 결과를 비교하며, 단일 언어 및 이중 언어 텍스트 코퍼스를 사용한 다중모달 융합 결과를 비교한다.

실험 결과
연구 질문
- RQ1최신 VLM의 성능은 객관적 과제와 주관적 과제 모두에서 서양 문화 이미지 서브셋과 동양 문화 이미지 서브셋 간에 뚜렷하게 다를까?
- RQ2텍스트 전용 사전 훈련에서 언어 분포가 VLM의 문화적 편향에 어떤 영향을 미치는가?
- RQ3비영어 언어(예: 중국어)로 프롬프팅하는 것이 VLM의 서양 편향을 줄일 수 있으며, 만약 그렇다면 이 효과가 가장 강하게 나타나는 조건은 무엇인가?
- RQ4다국어 사전 훈련의 균형 잡힌 분포가 다국어 프롬프팅만으로는 더 효과적인가?
- RQ5훈련 단계에서 다중모달 융합 코퍼스에 중국어를 포함시키면 서양 편향이 줄어들며, 이는 오직 영어만 사용한 경우와 비교해 어떤가?
주요 결과
- 모든 평가 과제에서 VLM는 뚜렷한 서양 편향을 보이며, 객체 식별, 질의 응답, 예술 감정 분류 과제 모두에서 서양 이미지 서브셋에서 성능이 높게 나타난다.
- 사전 훈련 단계에서 더 균형 잡힌 언어 혼합(예: 영어와 중국어)을 사용하면, 영어로 추론을 수행하더라도 VLM의 서양 편향이 감소한다.
- 중국어로 프롬프팅하면 편향 감소 효과가 있지만, 이 효과는 사전 훈련 단계에서 중국어가 잘 반영된 경우에 훨씬 더 뚜렷하다. 이는 사전 훈련 단계의 언어 혼합 비율이 추론 언어보다 더 중요하다는 것을 시사한다.
- 주관적 과제인 예술 감정 분류에서는 편향 감소 효과가 더 두드러지지만, 객관적 과제인 객체 식별 과제도 균형 잡힌 사전 훈련을 통해 측정 가능한 향상이 나타난다.
- Baichuan2 기반 모델은 Llama2 기반 모델보다 중국어 시각적 관점과 더 잘 일치하는 경향을 보이며, 히든 스테이트 프로빙을 통해 Baichuan2가 문화적으로 특화된 시각적 연관성을 더 잘 포착하는 것으로 확인된다.
- 이중 언어 코퍼스를 사용한 다중모달 융합은 일관되게 편향 감소를 이끌지 못하며, 이는 사전 훈련 단계에서 언어 분포가 융합 데이터의 언어보다 더 큰 영향을 미친다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.