Skip to main content
QUICK REVIEW

[논문 리뷰] GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language Models

Tao Zhang, Ziqian Zeng|arXiv (Cornell University)|2024. 06. 20.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(LM)의 성별 편향을 줄이기 위해 공개된 8,000개 샘플로 구성된 어울림 데이터셋인 GenderAlign을 소개한다. 기존 데이터셋과 책들에서 유래한 시드 텍스트를 바탕으로 GPT-3.5를 사용해 '선택된'(저편향, 고품질) 및 '기각된'(고편향) 응답 쌍을 생성함으로써, 저자들은 GenderAlign으로 LLM을 피지테이닝하면 기존의 HH-RLHF와 같은 데이터셋보다 성별 편향이 크게 감소하는 것으로 밝혀냈다. 인간 평가자와 LLM 평가자 모두 GenderAlign으로 훈련된 모델의 출력을 일관되게 선호함을 입증하였다.

ABSTRACT

Large Language Models (LLMs) are prone to generating content that exhibits gender biases, raising significant ethical concerns. Alignment, the process of fine-tuning LLMs to better align with desired behaviors, is recognized as an effective approach to mitigate gender biases. Although proprietary LLMs have made significant strides in mitigating gender bias, their alignment datasets are not publicly available. The commonly used and publicly available alignment dataset, HH-RLHF, still exhibits gender bias to some extent. There is a lack of publicly available alignment datasets specifically designed to address gender bias. Hence, we developed a new dataset named GenderAlign, aiming at mitigating a comprehensive set of gender biases in LLMs. This dataset comprises 8k single-turn dialogues, each paired with a "chosen" and a "rejected" response. Compared to the "rejected" responses, the "chosen" responses demonstrate lower levels of gender bias and higher quality. Furthermore, we categorized the gender biases in the "rejected" responses of GenderAlign into 4 principal categories. The experimental results show the effectiveness of GenderAlign in reducing gender bias in LLMs.

연구 동기 및 목표

  • 대규모 언어 모델(LM)에서 성별 편향 완화를 전적으로 목표로 하는 공개된 어울림 데이터셋의 부족을 해결하기 위해.
  • 성별 편향이 포함된 응답과 이를 해소한 응답을 고려한 고품질, 다양하고 체계적으로 분류된 데이터셋을 구축하여 LLM의 피지테이닝을 위한 목적으로.
  • 제안된 데이터셋이 다양한 LLM과 벤치마크에서 성별 편향 감소에 얼마나 효과적인지 평가하기 위해.
  • 다양한 데이터 원천(예: 책, 기존 데이터셋 등)이 성별 편향 완화 성능에 기여하는 방식을 분석하기 위해.
  • 성과 평형을 위한 성별 평등에 초점을 맞춘 자동화된 반복 가능한 데이터 어울림 파이프라인을 제공하기 위해.

제안 방법

  • 8,000개의 단일 대화를 포함한 데이터셋은 GPT-3.5를 사용해 생성되었으며, 각 대화에는 '선택된' 응답(성별 편향 없음, 고품질)과 '기각된' 응답(성별 편향 있음)이 포함되어 있다.
  • 성별 관련 주제의 시드 텍스트는 두 개의 기존 데이터셋(CORGI-PM, Workplace-Sexism)과 성별 및 성별 역할에 관한 다섯 권의 책에서 수집되었다.
  • '선택된' 응답은 대화 맥락을 바탕으로 성별 평등 원칙에 부합하는 응답을 생성하도록 GPT-3.5에 프롬프트하여 생성되었다.
  • '기각된' 응답은 '선택된' 응답을 맥락에서 제거한 후, 어울림이 없는 LLM에 응답을 생성하도록 프롬프트하여 편향이 더 높아질 가능성을 높였다.
  • 기각된 응답에 포함된 성별 편향은 네 가지 주요 유형으로 분류된다: 성별 스테레오타입, 차별적 언어, 기관 내 성차별, 소수성별에 대한 편향.
  • 데이터셋은 LLM 평가자(GPT-3.5, Gemini-Pro, Claude-3-opus)와 인간 평가자를 통해 평가되었으며, 선호도 순위를 사용해 편향 감소 효과를 평가하였다.
Figure 1: “Chosen” and “ Rejected” response generation workflow. The input is a text either exhibits gender bias or describes gender difference.
Figure 1: “Chosen” and “ Rejected” response generation workflow. The input is a text either exhibits gender bias or describes gender difference.

실험 결과

연구 질문

  • RQ1기존의 공개된 데이터셋인 HH-RLHF와 비교해, 자동화된 LLM 기반 어울림 데이터셋이 피지테이닝된 LLM의 성별 편향을 효과적으로 줄일 수 있는가?
  • RQ2책과 기존 데이터셋과 같은 다양한 데이터 원천이 GenderAlign 데이터셋의 성별 편향 완화 성능에 기여하는 방식은 어떠한가?
  • RQ3GenderAlign으로 피지테이닝한 모델이 BBQ 및 WinoGender와 같은 표준 벤치마크에서 성별 편향을 얼마나 줄이는가?
  • RQ4인간 평가자와 LLM 평가자 간에 GenderAlign으로 피지테이닝한 모델의 응답과 다른 어울림 데이터셋의 응답을 선호하는 데에 어떤 차이가 있는가?
  • RQ5GPT-3.5를 통한 자동 주석 처리가 데이터셋의 탈편향 목표를 뒤엎는 새로운 편향을 유발하는가?

주요 결과

  • Human 평가자들은 GenderAlign으로 피지테이닝한 모델의 출력을 51.1%의 비율로 선호했으며, Claude-3-opus는 65.8%의 비율로 선호하여 HH-RLHF 및 Harmless 데이터셋으로 훈련된 모델보다 유의미하게 뛰어난 성능을 보였다.
  • GenderAlign으로 피지테이닝한 Llama2-13B 모델는 BBQ 벤치마크에서 높은 정확도를 유지하면서도 가장 낮은 성별 편향을 기록했으며, 베이스 모델과 Harmless로 피지테이닝한 모델보다 뛰어난 성능을 보였다.
  • 직업 관련 스테레오타입에 대한 성별 편향의 평균 피어슨 상관계수는 GenderAlign으로 훈련된 모델에서 가장 낮아, 스테레오타입적인 성별-직업 연관성과의 일치도가 감소한 것으로 나타났다.
  • GenderAlign의 책 기반 또는 데이터셋 기반 구성 요소를 제거하면 편향 감소 성능이 떨어졌으며, 특히 Workplace-Sexism (CW) 서브셋이 책보다 더 효과적인 기여를 하였다.
  • 인간 평가자 간의 일치도가 높았으며(Fleiss’ Kappa = 0.655), 이는 다양한 평가자 간에 GenderAlign으로 훈련된 모델의 출력을 일관되게 선호하는 경향이 있음을 시사한다.
  • Harmless 데이터셋은 어울림을 위해 설계되었음에도 불구하고 성별 편향 감소에 실패했고, 일부 경우에서는 오히려 편향을 증가시켰다. 이는 기존 어울림 데이터가 편향 완화에 한계를 가짐을 보여준다.
(a) GenderAlign dataset.
(a) GenderAlign dataset.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.