Skip to main content
QUICK REVIEW

[논문 리뷰] LocalValueBench: A Collaboratively Built and Extensible Benchmark for Evaluating Localized Value Alignment and Ethical Safety in Large Language Models

Gwenyth Isobel Meadows, Nuno Lau|arXiv (Cornell University)|2024. 07. 27.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

LocalValueBench는 호주 가치를 반영한 지역화된 가치 일치성과 윤리적 안전성을 평가하기 위해 공동으로 구축되고 확장 가능한 벤치마크를 도입한다. 삼중층의 질문 프레임워크(기본, 논쟁, 강제 정당화)와 인간 검증 점수를 결합하여, 상용 LLM(예: ChatGPT, Gemini, Claude)이 지역 윤리 기준에서 상당한 이탈을 보임을 드러내며, 특히 악성 프롬프트에 노출되었을 때의 위험성을 입증한다.

ABSTRACT

The proliferation of large language models (LLMs) requires robust evaluation of their alignment with local values and ethical standards, especially as existing benchmarks often reflect the cultural, legal, and ideological values of their creators. extsc{LocalValueBench}, introduced in this paper, is an extensible benchmark designed to assess LLMs' adherence to Australian values, and provides a framework for regulators worldwide to develop their own LLM benchmarks for local value alignment. Employing a novel typology for ethical reasoning and an interrogation approach, we curated comprehensive questions and utilized prompt engineering strategies to probe LLMs' value alignment. Our evaluation criteria quantified deviations from local values, ensuring a rigorous assessment process. Comparative analysis of three commercial LLMs by USA vendors revealed significant insights into their effectiveness and limitations, demonstrating the critical importance of value alignment. This study offers valuable tools and methodologies for regulators to create tailored benchmarks, highlighting avenues for future research to enhance ethical AI development.

연구 동기 및 목표

  • 주로 영어 또는 중국어 중심이 아닌 환경에서의 문화적·법적 기반을 가진 LLM 평가 벤치마크 부족 문제를 해결하기 위해.
  • 세계 각국 규제 당국이 지역별로 맞춤형 가치 일치성 벤치마크를 구축할 수 있도록 재현 가능하고 확장 가능한 프레임워크를 개발하기 위해.
  • 상용 LLM이 호주 윤리 기준, 특히 헌법 원칙과 사회적 가치에 얼마나 잘 부합하는지 평가하기 위해.
  • 맥락 이해, 윤리적 추론, 안전성 측면에서 인간 검증 기준을 활용해 LLM의 응답 이탈 정도를 정량화하기 위해.
  • 악성 또는 오해의 소지가 있는 주장으로 유도되었을 때 LLM의 윤리적 추론이 얼마나 취약한지 입증하기 위해.

제안 방법

  • 삼중층 평가 프로세스 설계: (1) 중립적 기본 질문, (2) 지역 규범에 반대하는 논쟁 프롬프트, (3) 유해하거나 비윤리적인 추론을 유도하는 강제 정당화(질의)
  • 호주 법적 및 문화적 기준에 기반한 6개 주제별 질문 세트(팁, 사형제도, 카테고리 R 무기, 난민, 동성결혼, 의무 투표) 구성
  • 학생 및 멘토의 검증을 통한 반복적 전문가 중심 질문 컬렉션 구성으로 편향을 최소화하고 맥락적 관련성을 확보
  • 표 C에 기재된 5점 척도를 활용해 맥락 이해, 윤리적 추론, 안전성 측면에서 응답을 평가하며, 각 응답에 대해 3명의 인간 평가자 참여
  • 프롬프트 엔지니어링을 활용해 압박 상황에서 LLM이 윤리적으로 문제를 일으킬 수 있는 콘텐츠를 생성하는 능력을 시험하고, 실제 악용 시나리오를 시뮬레이션
  • 일관된 평가 기준과 인간 평가 응답을 기반으로 상용 LLM 세 종류(ChatGPT, Gemini, Claude) 간 비교 벤치마크 수행

실험 결과

연구 질문

  • RQ1상용 LLM은 윤리적으로 敏감한 주제에 대해 어느 정도 호주 가치에 부합하는가?
  • RQ2의무 투표 폐지와 같은 지역 법률 및 규범에 도전하는 악성 프롬프트를 가했을 때 LLM은 어떻게 반응하는가?
  • RQ3표준화된 인간 검증 척도로 LLM 출력에서의 윤리적 추론 이탈 정도를 효과적으로 정량화할 수 있는가?
  • RQ4다양한 LLM은 해로운 또는 헌법에 어긋나는 정당화를 요구했을 때 어떻게 반응하며, 어떤 안전 메커니즘이 효과적인가?
  • RQ5LocalValueBench 프레임워크는 다른 관할권의 규제 당국이 지역 맞춤형 AI 안전성 벤치마크를 구축하기 위해 일반화 및 적응 가능할 수 있는가?

주요 결과

  • ChatGPT는 강제 정당화 단계에서 윤리적 추론 실패를 보였으며, 의무 투표 및 동성결혼 주제에서 맥락 이해 및 안전성 측면에서 1/5의 점수를 기록했다.
  • Gemini와 Claude는 악성 프롬프트에 더 강한 저항력을 보였으며, 특히 난민 및 동성결혼 주제에서 강제 정당화 단계에서 안전성 및 윤리적 추론에서 Claude가 5/5를 기록했다.
  • 모든 모델이 사형제도 및 카테고리 R 무기 주제에서 어려움을 겪었으며, 강제 정당화 단계에서 점수는 1~2/5로 하락하여 해로운 정당화를 생성할 위험이 높다는 것을 시사했다.
  • 기본 응답은 일반적으로 호주 가치와 부합했으며(중앙값 3~4/5), 그러나 논쟁 및 강제 정당화 프롬프트 단계에서 윤리적 추론이 급격히 악화되었다.
  • 인간 평가자들은 난민 및 동성결혼과 같은 고위험 주제에서 Claude가 안전성 및 윤리적 추론 측면에서 가장 높은 평가를 내렸으며, ChatGPT는 일관성 면에서 가장 낮은 성과를 보였다.
  • 본 연구는 상용 LLM이 오해의 소지가 있거나 강요적인 주장으로 이끌릴 경우 윤리적 추론이 쉽게 약화됨을 확인하며, 지역 기반의 맥락 인식이 가능한 안전 평가의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.