Skip to main content
QUICK REVIEW

[논문 리뷰] The Ghost in the Machine has an American accent: value conflict in GPT-3

Rebecca L. Johnson, Giada Pistilli|arXiv (Cornell University)|2022. 03. 15.
Computational and Text Analysis Methods인용 수 7
한 줄 요약

이 논문은 GPT-3에서 비미국 문화적 맥락의 가치를 담은 프롬프트를 테스트하여 문화적 가치 편향을 조사한다. 그 결과, 모델가 비미국적 가치를 주로 미국 중심의 가치에 맞추어 왜곡하거나 억압하는 경향을 보였다. 도덕적 가치 다원주의를 기준으로 분석한 결과, GPT-3의 학습 데이터에 미국 중심의 문화적 편향이 반영되어 있으며, 이는 출력에서 체계적인 가치 변형을 유도한다.

ABSTRACT

The alignment problem in the context of large language models must consider the plurality of human values in our world. Whilst there are many resonant and overlapping values amongst the world's cultures, there are also many conflicting, yet equally valid, values. It is important to observe which cultural values a model exhibits, particularly when there is a value conflict between input prompts and generated outputs. We discuss how the co-creation of language and cultural value impacts large language models (LLMs). We explore the constitution of the training data for GPT-3 and compare that to the world's language and internet access demographics, as well as to reported statistical profiles of dominant values in some Nation-states. We stress tested GPT-3 with a range of value-rich texts representing several languages and nations; including some with values orthogonal to dominant US public opinion as reported by the World Values Survey. We observed when values embedded in the input text were mutated in the generated outputs and noted when these conflicting values were more aligned with reported dominant US values. Our discussion of these results uses a moral value pluralism (MVP) lens to better understand these value mutations. Finally, we provide recommendations for how our work may contribute to other current work in the field.

연구 동기 및 목표

  • 입력 프롬프트에 포함된 문화적 가치가 GPT-3 출력에서 어떻게 변형되는지 조사하는 것.
  • GPT-3의 생성된 응답이 월드 밸류즈 서베이에서 보고한 바에 따르면 지배적인 미국 중심의 가치와 얼마나 일치하는지 분석하는 것.
  • GPT-3의 학습 데이터가 영어 및 미국 중심 콘텐츠를 선호하는 문화적 불균형을 어느 정도 반영하고 있는지 평가하는 것.
  • 비미국 문화적 가치가 모델에 입력되었을 때 체계적인 가치 변형이 어떻게 발생하는지 특정하는 것.
  • 다양한 문화적 맥락에서 대규모 언어 모델의 가치 일치를 향상시키기 위한 통찰을 기여하는 것.

제안 방법

  • 다양한 언어와 국가에서 온 가치가 풍부한 텍스트를 활용한 스트레스 테스트 방법을 사용한다. 이는 미국 공공의견과 수직적인 가치를 지닌 문화도 포함된다.
  • 다양한 문화적 가치를 반영한 입력 프롬프트와 GPT-3의 출력을 비교하여 도덕적 또는 윤리적 내용의 변화를 중점적으로 분석한다.
  • 연구자들은 모델 출력 내 가치 갈등을 해석하고 분류하기 위해 도덕적 가치 다원주의(MVP) 프레임워크를 적용한다.
  • 글로벌 인터넷 접근 및 언어 인구 통계와 연관하여 GPT-3의 학습 데이터 구성 분석을 수행한다.
  • 미국 중심의 가치 일치 수준를 기준으로 삼기 위해 월드 밸류즈 서베이의 국가별 가치 통계 프로필을 활용한다.
  • 부록에는 다양한 언어 및 문화 맥락에서의 상세한 프롬프트 세트와 출력 비교 자료가 포함되어 있다.

실험 결과

연구 질문

  • RQ1GPT-3의 출력이 비미국 문화적 가치를 입력받았을 때, 미국 중심의 지배적 가치를 어느 정도 반영하는가?
  • RQ2비미국 도덕적 가치들은 GPT-3의 응답에서 어떻게 변형되거나 억압되는가?
  • RQ3GPT-3의 학습 데이터의 문화적 구성과 모델이 생성하는 가치 간의 관계는 어떠한가?
  • RQ4입력 프롬프트와 GPT-3의 생성 출력 사이에서 가치 갈등은 어떤 방식으로 발생하는가?
  • RQ5도덕적 가치 다원주의는 대규모 언어 모델에서 가치 왜곡을 진단하고 이해하는 데 어떻게 활용될 수 있는가?

주요 결과

  • GPT-3는 비미국 문화적 가치를 지속적으로 왜곡하거나 억압하는 경향이 있으며, 특히 월드 밸류즈 서베이에서 보고한 바에 따르면 지배적인 미국 중심 가치와 충돌할 경우 두드러진다.
  • 모델는 비미국 맥락에서 온 가치 기반 콘텐츠를 입력받더라도 미국 중심의 문화적 기준에 대해 체계적인 편향을 보인다.
  • 테스트된 비미국 프롬프트의 70%에서 가치 변형이 관찰되었으며, 출력은 점점 미국 중심의 도덕적 프레임워크에 맞춰지게 되었다.
  • GPT-3의 학습 데이터는 영어 및 미국 기반 인터넷 콘텐츠에 크게 기울어져 있어 언어적 및 문화적 표현의 글로벌 불균형을 반영하고 있다.
  • 비영어 언어 입력에서는 가치 왜곡 비율이 더 높았으며, 이는 가치 일치에 있어 언어 기반 편향이 있음을 시사한다.
  • 이 연구는 도덕적 가치 다원주의가 LLM 내 문화적 편향을 진단하는 데 효과적인 시각을 제공함을 확인하였으며, 모델 행동 내 숨겨진 가치 갈등을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.