Skip to main content
QUICK REVIEW

[논문 리뷰] Do Moral Judgment and Reasoning Capability of LLMs Change with Language? A Study using the Multilingual Defining Issues Test

Aditi Khandelwal, Utkarsh Agarwal|arXiv (Cornell University)|2024. 02. 03.
Corporate Finance and GovernanceBusiness, Management and Accounting인용 수 3
한 줄 요약

이 연구는 다국어 정의 문제 테스트(DIT)를 사용하여 영어, 스페인어, 러시아어, 중국어, 히누어, 스폐니시어 6개 언어에서 대규모 언어 모델(LLM)의 도덕적 판단 및 추론 능력을 평가한다. GPT-4는 모든 언어에서 일관된 초기도덕적 추론을 유지하지만, 히누어와 스포아니어에서는 Llama2Chat-70B와 ChatGPT의 성능이 상당히 떨어지며, 이는 훈련 데이터와 언어적 요소에 의해 영향을 받는 언어에 의존하는 도덕적 추론 능력의 변동성을 보여준다.

ABSTRACT

This paper explores the moral judgment and moral reasoning abilities exhibited by Large Language Models (LLMs) across languages through the Defining Issues Test. It is a well known fact that moral judgment depends on the language in which the question is asked. We extend the work of beyond English, to 5 new languages (Chinese, Hindi, Russian, Spanish and Swahili), and probe three LLMs -- ChatGPT, GPT-4 and Llama2Chat-70B -- that shows substantial multilingual text processing and generation abilities. Our study shows that the moral reasoning ability for all models, as indicated by the post-conventional score, is substantially inferior for Hindi and Swahili, compared to Spanish, Russian, Chinese and English, while there is no clear trend for the performance of the latter four languages. The moral judgments too vary considerably by the language.

연구 동기 및 목표

  • LLM의 도덕적 판단 및 추론 능력이 다양한 언어 간에 달라지는지 조사하는 것.
  • 이전의 영어 전용 연구를 다국어 환경으로 확장하기 위해 정의 문제 테스트(DIT)를 활용하는 것.
  • 언어별 훈련 데이터와 언어 다양성이 LLM의 도덕적 추론 성능에 미치는 영향을 평가하는 것.
  • 훈련 데이터의 문화적 및 언어적 차이가 도덕적 딜레마 상황에서 모델 행동에 영향을 미치는지 조사하는 것.
  • 향후 다국어 도덕적 추론 연구를 위해 다국어 DIT 데이터셋을 제작하고 공개하는 것.

제안 방법

  • Google 번역을 사용하여 원래 DIT 도덕적 딜레마를 스페인어, 러시아어, 중국어, 히누어, 스포아니어로 5개 신규 언어로 변환하고 수동 검증을 실시함.
  • GPT-4, ChatGPT, Llama2Chat-70B의 3개 LLM을 대상으로 각 딜레마를 해결하고 상위 4개의 도덕적 고려사항을 순위 매김함.
  • DIT 프레임워크에 기반한 도덕적 발달 단계 점수(P-점수)를 계산하여 후기도덕적, 전통적, 초기도덕적 추론를 반영함.
  • 언어 간 P-점수 비교를 위해 통계적 유의성 검정(Mann-Whitney U 검정)을 사용하여 유의미한 차이를 식별함.
  • 모델의 응답을 콘라베르그의 인지적 도덕 발달(CMD) 이론에 기반해 분석하여 추론 단계로 분류함.
  • 딜레마 및 언어 간 도덕적 판단과 추론 일관성을 평가하여 패턴과 이질성을 식별함.
(a) ChatGPT
(a) ChatGPT

실험 결과

연구 질문

  • RQ1LLM의 도덕적 추론 능력이 다양한 언어 간에 유의미하게 달라지는가?
  • RQ2GPT-4, ChatGPT, Llama2Chat-70B는 다국어 환경에서 도덕적 추론 성능에서 어떻게 비교되는가?
  • RQ3히누어와 스포아니어와 같은 고자원 언어와 저자원 언어 간에 도덕적 판단에 유의미한 차이가 있는가?
  • RQ4훈련 데이터와 언어 다양성이 LLM의 도덕적 추론을 다국어 환경에서 어떻게 형성하는가?
  • RQ5훈련 데이터의 문화적 및 언어적 요소가 LLM의 도덕적 의사결정에 얼마나 영향을 미치는가?

주요 결과

  • GPT-4는 모든 6개 언어에서 가장 일관된 후기도덕적 추론을 보이며, P-점수의 변동이 최소한이었다.
  • Llama2Chat-70B와 ChatGPT의 경우, 히누어와 스포아니어에서 영어, 스페인어, 러시아어, 중국어와 비교해 도덕적 추론 성능이 상당히 떨어졌다.
  • 도덕적 판단 일치도는 영어, 중국어, 스페인어에서 가장 높았으며, 영어와 러시아어는 유사한 추론 점수를 보였지만 유의미한 차이가 있었다.
  • 헤이즈 딜레마에서 언어 간 P-점수의 유의미한 차이가 가장 크게 나타났고, 이어 뉴스레터 딜레마에서 그 다음으로 높았다.
  • 웹스터 딜레마와 죄수 딜레마의 경우, 어떤 모델에 대해서도 언어 간 P-점수에 유의미한 차이가 없었다.
  • 히누어에서는 ChatGPT와 Llama2Chat-70B의 성능이 랜덤 기준선 수준 이하였으며, 이는 심각한 추론 성능 저하를 시사한다.
(b) Llama2Chat-70B
(b) Llama2Chat-70B

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.