[논문 리뷰] Ethical Reasoning over Moral Alignment: A Case and Framework for In-Context Ethical Policies in LLMs
이 논문은 LLM 훈련에서 윤리적 가치 조율을 분리하여, 도덕 원칙을 하드코딩하는 대신 일반적인 윤리적 추론 능력을 갖춘 모델을 제공하는 것을 제안한다. 다양한 윤리 이론(도덕주의, 덕성론, 결과주의)에서 유래한 도덕적 딜레마와 정책을 다양한 추상 수준에서 통합한 프레임워크를 도입함으로써, 맥락 내 윤리적 의사결정을 가능하게 한다. GPT-4는 거의 완벽한 추론을 보였지만, 모든 모델이 전통적 또는 공동체 중심 윤리보다 서양의 개인주의적 가치에 강한 편향을 보였다.
In this position paper, we argue that instead of morally aligning LLMs to specific set of ethical principles, we should infuse generic ethical reasoning capabilities into them so that they can handle value pluralism at a global scale. When provided with an ethical policy, an LLM should be capable of making decisions that are ethically consistent to the policy. We develop a framework that integrates moral dilemmas with moral principles pertaining to different foramlisms of normative ethics, and at different levels of abstractions. Initial experiments with GPT-x models shows that while GPT-4 is a nearly perfect ethical reasoner, the models still have bias towards the moral values of Western and English speaking societies.
연구 동기 및 목표
- LLM에서 사전에 조율된 도덕적 가치를 반박하고 일반적인 윤리적 추론을 주장함.
- 윤리적 AI에서 가치의 다원성을 다루기 위해 사용자가 제공한 정책에 기반한 LLM의 윤리적 추론 능력을 제공함.
- 프롬프트에서 윤리 정책를 명시하고 평가하기 위한 체계적 프레임워크를 개발함.
- 현재 LLM에서 글로벌 남부 및 이슬람 문화 가치에 대한 문화적 및 가치 기반 편향을 특정하고 정량화함.
- 하드코딩된 윤리가 아닌, 애플리케이션 수준에서 맥락에 민감하고 맞춤형 윤리적 의사결정을 가능하게 함.
제안 방법
- 상호관계, 전문적, 사회적, 문화적 가치 갈등을 반영하는 12개의 도덕적 딜레마 설계.
- 다양한 추상 수준에서 규범적 윤리 이론(도덕주의, 덕성론, 결과주의)에 기반한 윤리 정책 정의.
- 이러한 딜레마와 정책을 맥락 내 프롬프트에 통합하여, 다양한 도덕적 입장을 기반으로 LLM의 윤리적 추론 능력을 평가함.
- GPT-x 시리즈 모델(GPT-4 포함)을 사용하여 다양한 윤리적 시나리오에서의 추론 성능 테스트.
- 모델 출력을 분석하여 지정된 정책과의 일관성을 확인하고 가치 선호도에서의 편향 탐지.
- Inglehart-Welzel 문화 지도를 사용하여 모델 행동을 개인주의 대 전통성 등의 문화적 가치 차원에서 평가함.

실험 결과
연구 질문
- RQ1LLM이 사전에 조율된 가치 대신 맥락 내 정책 명시를 통해 윤리적 추론을 효과적으로 이끌 수 있는가?
- RQ2다양한 윤리 정책이 제공될 때, 다양한 LLM이 도덕적 딜레마를 어떻게 해결하는가?
- RQ3현재 LLM이 서양의 영어 사용 문화 기준을 특히 선호하는 경향을 보이며, 문화적 및 가치 기반 편향을 얼마나 보이는가?
- RQ4모델 크기와 복잡한 도덕적 시나리오에서의 윤리적 추론 능력 간의 상관관계는 어떠한가?
- RQ5일반적이고 확장 가능한 프레임워크가 통합된 프롬프팅 접근 방식에서 다양한 윤리 이론과 정책의 추상 수준을 지원할 수 있는가?
주요 결과
- GPT-4는 명확한 윤리 정책이 제공될 경우 거의 완벽한 윤리적 추론을 보이며, 의도된 도덕적 입장을 높은 일관성으로 따름.
- GPT-3 및 ChatGPT와 같은 작은 모델은 서양 문화에서 흔한 개인주의적, 자기 표현적, 민주적 가치에 상당한 편향을 보임.
- GPT-4를 포함한 모든 테스트된 모델은 전통적, 공동체 중심 또는 생존 중심 가치보다 서양 및 영어 사용 문화 가치를 강하게 선호함.
- 모델들은 종종 종교나 공동체 전통을 포함한 딜레마에서 문화적 규범을 존중하지 못하며, 예를 들어 힌두교의 채식 규칙을 선택적이라고 잘못 해석함.
- 윤리적 추론 능력은 모델 규모 증가에 따라 향상되지만, 최첨단 모델에서도 편향이 지속됨.
- 프레임워크는 현재 LLM이 문화적으로 중립적이지 않으며, 윤리적 추론이 프롬프트에 내재된 도덕적 가치에 매우 민감하다는 것을 성공적으로 드러냄.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.