[논문 리뷰] Probing the Moral Development of Large Language Models through Defining Issues Test
이 연구는 코헬버그의 인지적 도덕 발달 모델에 기반한 심리측정 도구인 정의적 문제 테스트(DIT)를 사용하여 대규모 언어 모델(LLM)의 도덕적 사고 능력을 평가한다. GPT-4는 대학원생 수준의 후기도덕적 사고 수준에 도달했으며, GPT-3는 랜덤 수준 이하로 나타나 다양한 모델 간 도덕적 사고 능력의 격차가 뚜렷하다.
In this study, we measure the moral reasoning ability of LLMs using the Defining Issues Test - a psychometric instrument developed for measuring the moral development stage of a person according to the Kohlberg's Cognitive Moral Development Model. DIT uses moral dilemmas followed by a set of ethical considerations that the respondent has to judge for importance in resolving the dilemma, and then rank-order them by importance. A moral development stage score of the respondent is then computed based on the relevance rating and ranking. Our study shows that early LLMs such as GPT-3 exhibit a moral reasoning ability no better than that of a random baseline, while ChatGPT, Llama2-Chat, PaLM-2 and GPT-4 show significantly better performance on this task, comparable to adult humans. GPT-4, in fact, has the highest post-conventional moral reasoning score, equivalent to that of typical graduate school students. However, we also observe that the models do not perform consistently across all dilemmas, pointing to important gaps in their understanding and reasoning abilities.
연구 동기 및 목표
- 표준화된 심리학적 도구를 사용하여 대규모 언어 모델(LLM)의 도덕적 사고 발달 수준을 평가하기 위해.
- LLM이 코헬버그의 단계에 따라 정의된 후기도덕적 사고 수준을 보이는지, 아니면 일반적 또는 전도덕적 수준에 머무는지 조사하기 위해.
- 특히 문화적 뉘앙스나 복잡한 맥락을 포함한 도덕적 딜레마에서 윤리적 사고 능력의 격차와 일관성 없는 점을 규명하기 위해.
- 모델 아키텍처, 크기, 정렬 기법(RLHF 등)이 도덕적 사고 능력에 어떤 영향을 미치는지 평가하기 위해.
- LLM이 인간 수준 또는 그 이상의 도덕적 사고 능력을 보일 경우 AI 정렬, 윤리, 향후 의사결정 역할에의 도입에 미치는 영향을 탐색하기 위해.
제안 방법
- LLM을 시험하기 위해 DIT를 변형하여 9개의 도덕적 딜레마를 제시하고, 각 도덕적 고려사항 12개를 중요도 순서로 정렬하도록 요청함.
- 각 딜레마다 12개 항목의 순서를 평가하는 데 사용된 정규화된 p_score 지표를 사용하여 윤리적 고려사항의 관련성과 순서를 점수화함.
- 7개의 LLM(GPT-3, GPT-3.5, GPT-4, ChatGPT(v1 및 v2), PaLM-2, Llama2-Chat(70B))의 응답을 확보함. 5개의 표준 DIT 딜레마와 4개의 새로 설계된 문화적으로 다양한 딜레마를 통해 데이터 오염을 방지함.
- p_score를 사용하여 코헬버그의 단계(전도덕적, 일반적, 후기도덕적)에 부합하는 정도를 반영하는 도덕 발달 단계 점수를 계산함.
- 랜덤 기준, 성인 인간, 대학원생과 같은 인간 기준과 비교하여 모델 성능을 평가함.
- 비논리적 또는 응답이 없는 출력(예: text-davinci-002)을 제외하고, PaLM-2가 갇힘의 딜레마에 응답하지 않아 평균치를 조정함.
실험 결과
연구 질문
- RQ1LLM이 코헬버그 모델이 정의한 후기도덕적 사고 수준을 어느 정도 보여주는가?
- RQ2특히 문화적 또는 맥락적 복잡성을 포함한 다양한 유형의 도덕적 딜레마에서 모델 성능은 어떻게 변하는가?
- RQ3모델 아키텍처, 크기, 정렬 기법(RLHF 등)과 도덕적 사고 능력 간의 관계는 어떠한가?
- RQ4일부 모델이 전체적으로는 높은 점수를 받았음에도 특정 딜레마에서는 성능이 떨어지는 이유는 무엇이며, 이는 그들의 사고 한계를 어떻게 드러내는가?
- RQ5LLM이 인간 수준 또는 그 이상의 도덕적 사고 능력을 달성할 수 있으며, 이는 AI 정렬과 실제 적용에 어떤 영향을 미치는가?
주요 결과
- GPT-4는 p_score 58.81을 기록하여 후기도덕적 사고 수준에 도달했으며, 일반적으로 대학원생 수준과 동일시됨.
- Llama2-Chat(70B)는 p_score 52.85를 기록하여 강력한 일반적 도덕적 사고 수준을 보이며, 성인 인간 또는 대학생 수준과 유사함.
- PaLM-2는 52.24를 기록하여 일반적 수준의 사고 능력을 보였지만, 갇힘의 딜레마에 응답하지 않아 효과적인 평균 점수가 낮아짐.
- GPT-3는 단지 31.20을 기록하여 무작위 기준 수준 이하로 나타나 의미 있는 도덕적 사고 능력이 없음.
- ChatGPTv1은 56.44를 기록했고, ChatGPTv2는 51.55를 기록하여 후속 버전에서 성능 저하 가능성이 있음을 시사하며, 일상적인 보고와 일치함.
- 9개의 딜레마 중 두 개의 딜레마에서 어떤 모델도 랜덤 기준을 초월하지 못했고, GPT-4는 새로 설계된 웹스터 딜레마에서 성능이 떨어져 여전히 지속적인 사고 일관성 문제를 드러냄.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.