[논문 리뷰] In-Contextual Gender Bias Suppression for Large Language Models
이 논문은 모델 파라미터나 디코딩 간섭 없이도 대규모 언어 모델(Large Language Models, LLMs)의 성별 편향을 억제하기 위한 프롬프트 기반 방법인 편향 억제를 제안한다. 신중하게 설계된 텍스트 프리앰블(역사적 진술과 직업 서술 문장)을 사용하여, 파라미터 접근이 불가능한 두 개의 오픈소스 LLM에서 성별 편향을 효과적으로 억제했으며, 하류 작업 성능 저하가 최소화되어 COPA에서 최대 5%의 정확도 감소, HellaSwag에서는 2–3%의 감소를 기록했다.
Despite their impressive performance in a wide range of NLP tasks, Large Language Models (LLMs) have been reported to encode worrying-levels of gender biases. Prior work has proposed debiasing methods that require human labelled examples, data augmentation and fine-tuning of LLMs, which are computationally costly. Moreover, one might not even have access to the model parameters for performing debiasing such as in the case of closed LLMs such as GPT-4. To address this challenge, we propose bias suppression that prevents biased generations of LLMs by simply providing textual preambles constructed from manually designed templates and real-world statistics, without accessing to model parameters. We show that, using CrowsPairs dataset, our textual preambles covering counterfactual statements can suppress gender biases in English LLMs such as LLaMA2. Moreover, we find that gender-neutral descriptions of gender-biased objects can also suppress their gender biases. Moreover, we show that bias suppression has acceptable adverse effect on downstream task performance with HellaSwag and COPA.
연구 동기 및 목표
- 파라미터 조정이나 디코딩 간섭이 불가능한 폐쇄소스 또는 API 접근 가능한 LLM에서 성별 편향을 완화하는 데 도전하는 것.
- 모델 제공자에 의존하지 않고도 최종 사용자가 독립적으로 편향을 억제할 수 있는 방법을 개발하는 것.
- LLM 내 성별 편향을 효과적으로 감소시키면서도 하류 작업 성능에 악영향을 최소화하는 것.
- 역사적 프리앰블(CF-*)과 서술적 프리앰블(Desc-*)과 같은 다양한 프리앰블 유형이 편향 억제 및 모델 성능에 미치는 영향을 탐색하는 것.
- 일반 목적의 LLM에 대해 편향 억제 기법을 적용할 수 있는지, 그로 인해 광범위한 유용성이 손상되지 않는지 조사하는 것.
제안 방법
- 성별 스테레오타입을 반박하는 템플릿을 사용해 CF-* 프리앰블을 설계하며, 예를 들어 '남성임에도 불구하고 {남성-이름}은(는) {여성-직업}이 되었다'와 같은 문장을 통해 편향된 연관성을 완화한다.
- 직업을 성 중립적인 방식으로 서술하는 Desc-* 프리앰블을 제작하며, 길이 영향을 평가하기 위해 3개 또는 7개의 서술어어를 사용한다.
- 모델의 주의 집중에 길이 기반 편향이 발생하지 않도록, 각 유형 간 단어 수를 균형 있게 유지한다.
- Crows-Pairs 벤치마크에서 성별 편향 억제 정도를 정량적으로 측정하기 위해 상대 편향 점수(Relative Bias Score, RBS)를 사용한다.
- COPA와 HellaSwag에서 퍼즐리티 기반으로 최고 성능을 보인 프리앰블 조합을 선택하여 하류 성능을 평가한다.
- 표준 자연어 처리 벤치마크를 사용하여, OpenLLaMA-7B와 MPT-7B라는 두 개의 오픈소스 LLM에 이 방법을 적용하고, 편향 및 작업 성능 양측을 평가한다.
실험 결과
연구 질문
- RQ1모델 파라미터에 접근할 수 없는 상황에서 컨텍스트 내 텍스트 프리앰블이 LLM의 성별 편향을 효과적으로 억제할 수 있는가?
- RQ2역사적 프리앰블(CF-*)과 서술적 프리앰블(Desc-*)은 편향 억제 능력에서 어떻게 비교되는가?
- RQ3프리앰블 길이와 유형이 일반 지식 추론 벤치마크에서 하류 작업 성능에 어떤 영향을 미치는가?
- RQ4프리앰블 기반의 편향 억제가 COPA 및 HellaSwag와 같은 표준 NLP 작업에서 심각한 성능 저하를 초래하는가?
- RQ5이 방법은 이원적 성별 편향을 넘어서 다른 유형의 사회적 편향에도 일반화될 수 있는가?
주요 결과
- CF-* 및 Desc-* 프리앰블은 Crows-Pairs 벤치마크에서 상대 편향 점수(RBS)로 측정한 결과, OpenLLaMA-7B와 MPT-7B에서 둘 다 성별 편향을 유의미하게 억제한다.
- 이 방법은 COPA 벤치마크에서 최대 5%의 성능 저하, HellaSwag에서는 2–3%의 성능 저하를 기록하여 하류 작업에 미치는 악영향이 최소임을 시사한다.
- 놀랍게도, CF-detailed 프리앰블은 HellaSwag에서 no-preamble(nc) 기준선을 뛰어넘는 성능을 보이기도 해 특정 맥락에서 성능 향상이 가능할 수 있음을 시사한다.
- 프리앰블 유형이나 프리앰블 수의 변화에 따른 유의미한 성능 차이는 관찰되지 않아, 이 방법이 강건하고 일관성을 유지함을 나타낸다.
- 이 방법은 OpenLLaMA-7B와 MPT-7B 등 다양한 LLM 아키텍처에서 효과를 유지하므로 광범위한 적용 가능성을 보인다.
- 작은 모델의 경우 CF-detailed 프리앰블이 더 명확한 맥락을 제공해 추론의 신뢰성을 향상시켜, 자원이 제한된 환경에서도 효과적임을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.