[논문 리뷰] Disclosure and Mitigation of Gender Bias in LLMs
본 논문은 명시적 성별 언급 없이 조건부 생성을 사용하여 LLM의 성별 편향을 드러내는 간접 탐색 프레임워크를 제안하고, 여러 모델에 걸쳐 세 가지 완화 전략(Hyperparameter Tuning, Instruction Guiding, Debias Tuning)을 평가한다.
Large Language Models (LLMs) can generate biased responses. Yet previous direct probing techniques contain either gender mentions or predefined gender stereotypes, which are challenging to comprehensively collect. Hence, we propose an indirect probing framework based on conditional generation. This approach aims to induce LLMs to disclose their gender bias even without explicit gender or stereotype mentions. We explore three distinct strategies to disclose explicit and implicit gender bias in LLMs. Our experiments demonstrate that all tested LLMs exhibit explicit and/or implicit gender bias, even when gender stereotypes are not present in the inputs. In addition, an increased model size or model alignment amplifies bias in most cases. Furthermore, we investigate three methods to mitigate bias in LLMs via Hyperparameter Tuning, Instruction Guiding, and Debias Tuning. Remarkably, these methods prove effective even in the absence of explicit genders or stereotypes.
연구 동기 및 목표
- 명시적 고정관념을 넘어 LLM 출력에서 성별 편향을 밝힐 필요성에 대한 동기를 제시한다.
- 명시적 성별 용어 없이 LLM이 성별 편향을 드러내도록 강제하는 간접 탐색 프레임워크를 개발한다.
- 명시적 편향과 암시적 편향을 정량화하는 지표를 정의하고 다수의 LLM에서 편향을 벤치마킹한다.
- 세 가지 편향 제거 전략을 평가하고 비교하여 가장 효과적인 방법을 식별한다.
제안 방법
- 명시적 성별 언급 없이 성별 편향을 이끌어내기 위한 조건부 생성 탐색을 소개한다.
- 세 가지 탐색 전략: 자연적으로 수집된 입력, LLM이 생성한 입력, 고정관념을 포함하는 템플릿 기반 입력.
- 명시적 편향 지표 GAS (Gender Attribute Score)와 암시적 편향 지표 GLD (Gender Logits Difference) 및 ADD (Attribute Distribution Distance)를 정의한다.
- 각 전략에서 편향을 평가하기 위해 모델 계열(LLaMA2, Vicuna, Falcon, OPT)에 걸쳐 열 개의 LLM을 탐색한다.
- 세 가지 완화 방법(Hyperparameter Tuning(온도, Top-p, Top-K), Instruction Guiding, Debias Tuning)을 평가한다.
- Debias Tuning은 Ld + Lg + Ll로 합산 손실을 사용하는 QLoRA 기반 접근 방식을 사용하여 성별 분포를 정렬하고 편향을 줄인다.
실험 결과
연구 질문
- RQ1RQ1: 명시적 고정관념이 필요하지 않을 때 서로 다른 탐색 전략에서 LLM은 어떻게 작동하는가?
- RQ2RQ2: 중립 프로브가 편향 공개에 있어 템플릿 기반 프롬프트보다 더 안정적이고 적합한가?
- RQ3RQ3: 더 크거나 정렬(alignment)된 모델이 더 많거나 덜한 편향을 나타내는가, 그리고 설정에 따라 완화 전략은 어떻게 작동하는가.
주요 결과
- 실험에 포함된 열 개의 LLM은 최소한 일부 탐색 전략에서 명시적 및/또는 암시적 성별 편향을 보인다.
- 템플릿 기반 프롬프트가 가장 강한 편향 신호를 보이고, 반면 중립 프로브는 모델과 입력에 걸쳐 편향을 더 안정적으로 드러낸다.
- 더 크거나 정렬된 모델은 더 강한 명시적 편향을 보이는 경향이 있지만 특정 조건에서 암시적 편향(GLD/ADD)은 감소할 수 있다.
- Instruction Guiding은 다수의 경우에서 명시적 및 암시적 편향을 모두 감소시키며, 특히 Naturally-sourced 입력에서 그렇다.
- Debias Tuning은 데이터세트 및 모델 변종에 걸쳐 가장 강력한 편향 완화 성능을 지속적으로 달성하며, Hyperparameter Tuning 및 Instruction Guiding를 능가한다.
- 입력에 명시적 성별이나 고정관념이 존재하지 않는 경우에도 Debias Tuning은 여전히 효과적이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.