Skip to main content
QUICK REVIEW

[논문 리뷰] KoSBi: A Dataset for Mitigating Social Bias Risks Towards Safer Large Language Model Application

Hwaran Lee, Seok‐Hee Hong|arXiv (Cornell University)|2023. 05. 28.
Topic Modeling인용 수 5
한 줄 요약

KoSBi는 34,214개의 문맥-문장 쌍으로 구성된 한국어 사회적 편향 데이터셋으로, 15개 카테고리에 걸쳐 72개의 인구집단을 대상으로 하며, LLM 생성 데이터를 바탕으로 인간이 검수한 자료를 활용해 제작되었다. KoSBi를 기반으로 미세조정된 분류기와 필터링 기반의 모더레이션 기법을 적용하여, HyperCLOVA(30B 및 82B)와 GPT-3에서 평균적으로 16.47%의 사회적 편향 감소를 입증하였으며, 문화적·언어적 특수성을 반영한 맥락에서 효과적인 편향 완화가 가능함을 보여주었다.

ABSTRACT

Large language models (LLMs) learn not only natural text generation abilities but also social biases against different demographic groups from real-world data. This poses a critical risk when deploying LLM-based applications. Existing research and resources are not readily applicable in South Korea due to the differences in language and culture, both of which significantly affect the biases and targeted demographic groups. This limitation requires localized social bias datasets to ensure the safe and effective deployment of LLMs. To this end, we present KO SB I, a new social bias dataset of 34k pairs of contexts and sentences in Korean covering 72 demographic groups in 15 categories. We find that through filtering-based moderation, social biases in generated content can be reduced by 16.47%p on average for HyperCLOVA (30B and 82B), and GPT-3.

연구 동기 및 목표

  • 한국에서 기존 데이터셋이 인구집단 범위와 문화적 관련성 측면에서 제한되어 있음에 비해, 문화적·언어적으로 특화된 사회적 편향 데이터셋의 부족 문제를 해결하기 위함.
  • 한국어 대규모 언어모델(LLM)에서 사회적 편향을 탐지하고 완화하기 위한 종합적이고 현지화된 자원을 개발하기 위함.
  • 정제된 인간 검수 데이터셋을 기반으로 훈련된 필터링 기반 모더레이션 시스템을 통해 LLM 생성 콘텐츠의 편향 완화를 효과적으로 구현하기 위함.
  • 기혼 상태, 지역 출신 등 소수에 속하는 인구집단과 같은 맥락 특화 인구집단을 포함함으로써, 한국에서 LLM 응용 프로그램의 안전한 구현을 보장하기 위함.

제안 방법

  • HyperCLOVA를 활용해, 72개의 인구집단을 15개 카테고리에 걸쳐 문맥 기반 소수 예측 프롬프트를 사용하여 34,214개의 문맥-문장 쌍을 생성함.
  • 스테레오타입, 편견, 차별 등 사회적 편향을 중심으로 데이터를 수집하고 정제하였으며, 유엔 인권 선언과 한국 국립인권위원회의 기준에 명시적으로 부합함.
  • 현장 작업자들을 활용해 각 문맥과 문장을 안전 또는 안전하지 않음으로 분류하였으며, 안전하지 않은 사례는 Fiske의 분류 체계(스테레오타입, 편견, 차별, 기타)를 추가로 적용함.
  • KoSBi 데이터셋을 기반으로 안전한 문장 분류기를 훈련시켜 추론 시 편향 콘텐츠를 식별함.
  • 다중 후보 응답을 생성하고 분류기 출력에 기반해 가장 안전한 응답을 선택하는 방식의 필터링 기반 모더레이션 전략(기각 샘플링)을 구현함.
  • GPT-3 및 HyperCLOVA 모델을 대상으로 1,746개의 문맥을 포함한 확장된 테스트 세트에서 인간 평가를 통해 방법의 유효성을 검증함.
Figure 1: Example pairs of a context and a sentence with labels pertaining to a given social demographic category and group.
Figure 1: Example pairs of a context and a sentence with labels pertaining to a given social demographic category and group.

실험 결과

연구 질문

  • RQ1한국어 LLM에 특화된 대규모 사회적 편향 데이터셋이 생성된 콘텐츠의 편향을 효과적으로 감소시킬 수 있는가?
  • RQ2KoSBi로 훈련된 분류기를 기반으로 한 필터링 기반 모더레이션은 다양한 인구집단에 걸쳐 한국어 LLM의 사회적 편향을 어느 정도 감소시키는가?
  • RQ3KoSBi를 미세조정 및 필터링 자원으로 사용할 경우, GPT-3, HyperCLOVA 30B/82B 등 다양한 LLM 아키텍처에서 편향 완화 성능은 어떻게 달라지는가?
  • RQ4지역 출신, 기혼 상태 등 소수에 속하는 인구집단이 포함될 경우, 한국에서 LLM 출력의 공정성과 안전성이 향상되는가?
  • RQ5필터링 적용 여부에 따라 인간 평가에서 어휘의 자연스러움, 논리적 일관성, 관련성은 어떻게 비교되는가?

주요 결과

  • KoSBi로 훈련된 분류기를 기반으로 한 필터링 기반 모더레이션은 HyperCLOVA(82B), HyperCLOVA(30B), GPT-3에서 평균적으로 16.47%의 사회적 편향 감소를 이룸.
  • 필터링 기반 접근법은 높은 어휘의 자연스러움과 일관성을 유지하였으며, GPT-3의 경우 문법 정확도가 2.0% 감소하고 이해도가 2.0% 하락하는 데 그침.
  • 인간 평가 결과, 모든 15개 인구집단 카테고리에서 안전성 향상이 확인되었으며, 특히 'LGBTQ+' 및 '내부 지역 출신' 집단에서 가장 높은 안전성 향상이 관찰됨.
  • 가장 높은 성능을 보인 분류기인 KcELECTRA는 테스트 세트에서 안전하지 않은 문장을 식별하는 데 92.5%의 정확도를 기록하여, 미리 보지 않은 데이터에 대한 강한 일반화 능력을 보임.
  • 문맥적 관련성과 응답 품질은 유지되었으며, 일관성과 관련성에 대해 약간의 감소만 관찰되어 안전성과 기능성 사이의 상충 요소가 최소화됨.
  • 지역적 특수성까지 반영한 '경상' 및 '전라'와 같은 정체성까지 포함한 72개의 인구집단과 15개의 카테고리로 구성된 데이터셋은 한국에서 보다 종합적이고 공정한 편향 완화를 가능하게 함.
Figure 2: Human evaluation on the subset of the test set. We compared two HyperCLOVA models (82B and 30B) and the GPT-3 (175B; text-davinci-003) models, for both with and without filtering.
Figure 2: Human evaluation on the subset of the test set. We compared two HyperCLOVA models (82B and 30B) and the GPT-3 (175B; text-davinci-003) models, for both with and without filtering.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.