[논문 리뷰] Cultural Bias and Cultural Alignment of Large Language Models
이 연구는 다섯 가지 널리 쓰이는 LLM에서 문화 편향을 국가 대표 설문 데이터와 비교해 평가하고, 최근 모델에서 문화 프롬핑이 대다수 국가의 정합성을 개선할 수 있음을 보여준다.
Culture fundamentally shapes people's reasoning, behavior, and communication. As people increasingly use generative artificial intelligence (AI) to expedite and automate personal and professional tasks, cultural values embedded in AI models may bias people's authentic expression and contribute to the dominance of certain cultures. We conduct a disaggregated evaluation of cultural bias for five widely used large language models (OpenAI's GPT-4o/4-turbo/4/3.5-turbo/3) by comparing the models' responses to nationally representative survey data. All models exhibit cultural values resembling English-speaking and Protestant European countries. We test cultural prompting as a control strategy to increase cultural alignment for each country/territory. For recent models (GPT-4, 4-turbo, 4o), this improves the cultural alignment of the models' output for 71-81% of countries and territories. We suggest using cultural prompting and ongoing evaluation to reduce cultural bias in the output of generative AI.
연구 동기 및 목표
- 문화가 LLM의 추론, 의사소통, 산출물에 어떤 영향을 미치는지 이해를 촉진한다.
- 다섯 가지 널리 사용되는 LLM의 문화 편향을 국가 대표 설문 데이터와 대조하여 정량화한다.
- 다국가/영토 간 문화 정합성을 개선하기 위한 제어 전략인 문화 프롬핑을 평가한다.
- 생성적 인공지능 산출물에서 문화 편향을 줄이기 위한 실행 가능한 지침을 제공한다.
제안 방법
- 다섯 가지 LLM에 대한 평가를 세분화한다: GPT-4o, GPT-4-turbo, GPT-4, GPT-3.5-turbo, GPT-3.
- 출력물에 반영된 문화 값을 평가하기 위해 모델 응답을 국가 대표 설문 데이터와 비교한다.
- 목표 문화 규범을 향해 모델 산출물을 유도하기 위한 제어 전략으로 문화 프롬핑을 적용한다.
- 프롬핑 전후의 국가/영토별 산출물의 문화 정합성을 측정한다.
- 최근 모델에 대해 국가/영토별 개선 비율(71-81%)을 보고한다.
실험 결과
연구 질문
- RQ1인기 있는 LLM이 영어권 및 개신교 유럽 맥락의 문화 가치를 어느 정도 암호화하고 반영하는가?
- RQ2문화 프롬핑이 다양한 국가/영토에 걸친 LLM 산출물의 문화 정합성을 개선할 수 있는가?
- RQ3최근 GPT-ffamily 모델과 초기 모델 간에 문화 정합성은 어떻게 다르게 나타나는가?
- RQ4현대 LLM에서 문화 프롱핑으로 향상된 정합성을 보이는 국가/영토의 비율은 얼마인가?
주요 결과
- 평가된 모든 모델은 영어권 및 개신교 유럽 국가들을 닮은 문화 가치를 나타낸다.
- 문화 프롬핑은 최근 모델들(GPT-4, 4-turbo, 4o)에서 71-81%의 국가/영토에 대해 문화 정합성을 개선한다.
- 문화 프롬핑은 LLM 산출물의 문화 편향을 줄이기 위한 효과적인 제어 전략이 될 수 있다.
- 본 연구는 LLM의 문화 편향에 대한 분해 가능한 국가별 평가의 실현 가능성을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.