Skip to main content
QUICK REVIEW

[논문 리뷰] Moral Mimicry: Large Language Models Produce Moral Rationalizations Tailored to Political Identity

Gabriel Simmons|arXiv (Cornell University)|2022. 09. 24.
Computational and Text Analysis Methods인용 수 11
한 줄 요약

이 연구는 대규모 언어 모델(Large Language Models, LLMs)이 도덕적 기초 이론(Moral Foundations Theory)을 기반으로 보수적 또는 보수적 정치 정체성과 일치하는 도덕적 정당화를 생성할 수 있는 '도덕적 모방(moral mimicry)' 능력을 보이는지 조사한다. 결과적으로 LLMs는 정치적 정체성에 맞는 도덕적 편향을 재생산하며, 모델이 클수록 이 모방 능력이 더 강해지는 것으로 나타났다. 이는 AI 생성 콘텐츠에서 이념적 극단화를 악화시킬 위험을 시사한다.

ABSTRACT

Large Language Models (LLMs) have demonstrated impressive capabilities in generating fluent text, as well as tendencies to reproduce undesirable social biases. This study investigates whether LLMs reproduce the moral biases associated with political groups in the United States, an instance of a broader capability herein termed moral mimicry. This hypothesis is explored in the GPT-3/3.5 and OPT families of Transformer-based LLMs. Using tools from Moral Foundations Theory, it is shown that these LLMs are indeed moral mimics. When prompted with a liberal or conservative political identity, the models generate text reflecting corresponding moral biases. This study also explores the relationship between moral mimicry and model size, and similarity between human and LLM moral word use.

연구 동기 및 목표

  • 대규모 언어 모델(Large Language Models, LLMs)이 정치 정체성과 관련된 도덕적 편향을 재생산하는지, 이를 '도덕적 모방(moral mimicry)'이라 부르는 현상인지 조사하는 것.
  • 모델 크기가 LLMs 내 도덕적 모방 정도에 미치는 영향을 분석하는 것.
  • LLMs가 생성한 도덕적 기초 사용 방식을 인간의 공감대와 개인의 인간 도덕어휘 사용 방식과 비교하는 것.
  • 시나리오 및 정체성 프롬프트에 기반해 LLMs가 맥락에 적절한 도덕적 정당화를 생성할 수 있는지 평가하는 것.

제안 방법

  • 표준화된 템플릿을 사용해 시나리오, 정치 정체성 어휘, 도덕적 입장을 결합한 프롬프트를 구성하였다.
  • 생성된 텍스트를 분석하기 위해 도덕적 기초 이론(Moral Foundations Theory, MFT)을 적용하였으며, 다섯 가지 기초를 중심으로 분석하였다: 보살피기/해로움, 공정성/기만, 충성심/배신, 권위/도전, 성결성/타락.
  • MFT 사전을 적용하여 LLM 완성문의 도덕적 기초 사용 빈도를 정량화하였다.
  • '보수적' 또는 '보수적' 정체성 조건 하에서의 모델 출력을 비교하여 도덕적 기초 사용의 차이를 측정하였다.
  • 모델 크기(GPT-3, GPT-3.5, OPT 등)와 도덕적 모방 강도 간의 관계를 평가하였다.
  • 효과 크기와 통계적 비교를 통해 인간과 LLM 간 도덕어휘 사용 유사도를 측정하였다.

실험 결과

연구 질문

  • RQ1LLMs는 보수적 또는 보수적 정치 정체성과 관련된 도덕적 기초를 반영하는 도덕적 정당화를 생성하는가?
  • RQ2모델 크기가 LLMs의 도덕적 모방 정도에 어떻게 영향을 미치는가?
  • RQ3LLMs가 생성한 텍스트에서 도덕적 기초 사용이 인간의 공감대와 개인의 인간 도덕어휘 사용과 얼마나 유사한가?
  • RQ4LLMs는 상황적 도덕적 시나리오에 따라 도덕적 기초 사용을 수정하는가?

주요 결과

  • LLMs는 프롬프트에 포함된 정치 정체성(보수적 또는 보수적)과 일치하는 도덕적 기초 사용을 보이며, 도덕적 모방을 나타낸다.
  • 도덕적 모방 정도는 모델 크가 증가할수록 증가하며, 특히 OPT 가족과 GPT-3/3.5 모델에서 두드러진다.
  • 더 큰 모델일수록 더 작은 모델보다 정치 정체성과 관련된 인간의 도덕적 기초 편향과 더 강하게 일치한다.
  • LLMs는 상황 맥락에 따라 도덕적 기초 사용을 수정하여 맥락과의 관련성을 높이지만, 인간 공감대와 완전히 동일하지는 않다.
  • LLMs가 생성한 도덕어휘는 인간 공감대의 도덕적 기초 사용과 인간 개인 간의 차이보다 더 다를 뿐 아니라, 이는 완벽한 모방이 아님을 시사한다.
  • 도덕적 모방은 GPT-3/3.5 및 OPT를 포함한 여러 LLM 가족에서 관찰되며, 최신 모델에서 일반화된 능력임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.