[논문 리뷰] A Survey on Fairness in Large Language Models
이 설문조사는 중간 규모 LLM(사전학습/미세조정)과 대규모 LLM(프롬프트 적용)의 공정성을 검토하며 평가 지표, 편향 제거 방법, 편향의 원인, 그리고 향후 방향을 다룹니다.
Large Language Models (LLMs) have shown powerful performance and development prospects and are widely deployed in the real world. However, LLMs can capture social biases from unprocessed training data and propagate the biases to downstream tasks. Unfair LLM systems have undesirable social impacts and potential harms. In this paper, we provide a comprehensive review of related research on fairness in LLMs. Considering the influence of parameter magnitude and training paradigm on research strategy, we divide existing fairness research into oriented to medium-sized LLMs under pre-training and fine-tuning paradigms and oriented to large-sized LLMs under prompting paradigms. First, for medium-sized LLMs, we introduce evaluation metrics and debiasing methods from the perspectives of intrinsic bias and extrinsic bias, respectively. Then, for large-sized LLMs, we introduce recent fairness research, including fairness evaluation, reasons for bias, and debiasing methods. Finally, we discuss and provide insight on the challenges and future directions for the development of fairness in LLMs.
연구 동기 및 목표
- 중간 규모 LLM과 대규모 LLM에서 공정성이 어떻게 정의되고 평가되는지 설명합니다.
- 중간 규모 LLM에 대한 고유 편향 제거 방법을 요약합니다.
- 프롬프트 방식에서 대규모 LLM의 공정성 평가, 편향 원인, 편향 제거 접근법을 조사합니다.
제안 방법
- 중간 규모 LLM에 대해 내재적(임베딩)과 외재적(하위 작업) 공정성 지표를 분류합니다.
- 내재적 편향 제거 방법: 전처리, 처리 중, 사후처리.
- 외재적 편향 제거 방법: 데이터 중심 및 모델 중심 접근법.
- 프롬프트에서 대규모 LLM의 공정성 평가 방법, 편향 원인, 편향 제거 전략을 검토합니다.
- LLM 공정성에 대한 도전과제와 향후 방향을 종합합니다.
실험 결과
연구 질문
- RQ1중간 규모 LLM에서 고유 및 외재적 공정성을 포착하는 평가 지표는 무엇인가?
- RQ2중간 규모 LLM에서 전처리, 처리 중, 사후처리 단계에 어떤 편향 제거 방법이 존재하는가?
- RQ3프롬프트 패러다임에서 대규모 LLM의 공정성은 어떻게 평가되고 편향 제거되는가?
- RQ4LLM의 공정성에 대한 주요 도전과제와 향후 방향은 무엇인가?
- RQ5대규모 LLM의 편향 뒤에 알려진 원인은 무엇이며 어떻게 완화할 수 있는가?
주요 결과
- 임베딩의 편향을 계량하는 고유 지표들(SEAT, CEAT, DisCo, LPBS, STS-B)이 있고, 외재적 지표는 핵심 인터페이스, 의미 유사성, 그룹 공정성 등의 하위 작업 공정성을 평가한다.
- 중간 규모 편향 제거는 데이터 수준, 모델 수준, 출력 수준의 기술을 전처리, 처리 중, 사후처리에 걸쳐 포괄한다.
- 대규모 LLM의 공정성은 프롬프트, 대화, 편향 벤치마크(BBQ, BiasAsker 등)를 통해 평가되며, 일부 설정에서의 개선에도 불구하고 지속적인 편향의 증거가 있다.
- 대규모 LLM의 편향은 학습 데이터의 편향, 모델 빈도 효과, 세계 지식 표현에서 발생하며, 능력의 상전이(phase transitions)가 편향 패턴에 영향을 준다.
- 대규모 LLM의 편향 제거는 여전히 도전적이며, 방법으로는 RLHF가 포함된 지시 학습, 프롬프트 엔지니어링, 보안 중심의 개선 등이 있다.
- 이 설문은 고유 편향과 외재적 편향 간의 신뢰할 수 없는 상관관계를 강조하고 다양한 벤치마크와 교차 지표 평가를 촉구한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.