[논문 리뷰] A Survey on Bias and Fairness in Natural Language Processing
이 종합 검토는 NLP에서의 편향과 공정성에 대한 현재의 이해를 종합적으로 분석하며, 데이터와 모델에서 기인하는 원인을 분석하고 공정성 정의를 체계화하며, NLP 하위 분야에서의 측정 지표와 편향 제거 기법을 평가한다. 연구 결과, 기존의 편향 제거 기법은 스케일링 시에 편향을 완전히 제거하지 못하는 경향이 있으며, WEAT와 같은 지표는 편향을 표면적으로만 탐지할 뿐, 후행 모델이 '편향 제거된' 임베딩에서 성별 연관성을 여전히 복구할 수 있음을 시사한다.
As NLP models become more integrated with the everyday lives of people, it becomes important to examine the social effect that the usage of these systems has. While these models understand language and have increased accuracy on difficult downstream tasks, there is evidence that these models amplify gender, racial and cultural stereotypes and lead to a vicious cycle in many settings. In this survey, we analyze the origins of biases, the definitions of fairness, and how different subfields of NLP mitigate bias. We finally discuss how future studies can work towards eradicating pernicious biases from NLP algorithms.
연구 동기 및 목표
- NLP에서의 편향 기원을 체계적으로 분석하기 위해, 레이블 편향, 선택 편향, 과도 확대 편향, 어휘 임베딩에서 유래한 의미 편향을 포함한다.
- 민족적 평등, 기회의 평등, 결과의 평등과 같은 주요 공정성 정의를 체계화하고 비교한다.
- 단어 임베딩과 후행 모델에서 편향을 측정하기 위해 WEAT 및 SEAT와 같은 기존 지표를 평가한다.
- 모델링, 문장 생성, 개체명 인식 등 NLP 하위 분야에서의 편향 제거 기법을 조사한다. 특히 적대적 학습과 데이터 증강 기법을 포함한다.
- 현재 기법의 핵심적 한계를 규명하고, 더 강력하고 일반화 가능한, 다학문적 접근이 필요한 편향 완화를 위한 새로운 방법론을 제안한다.
제안 방법
- 편향 원인을 네 가지 유형으로 분류한다: 레이블 편향, 선택 편향, 과도 확대 편향, 어휘 임베딩에서 기인한 의미 편향.
- 민족적 평등, 기회의 평등, 결과의 평등이라는 세 가지 공식 기준을 사용해 공정성 정의를 정의하며, 각각 다른 조건부 독립 요구 조건을 갖는다.
- 단어 임베딩과 모델 예측에서의 편향을 정량화하기 위해 워드 임베딩 연관 테스트(WEAT)와 문장 수준의 편향 평가(SEAT)를 활용한다.
- 적대적 학습과 같은 편향 제거 기법을 검토한다. 여기서 생성자는 성별 중립적인 유사어 관계를 학습하고, 판별자는 성별을 추론하려는 시도를 하며, 결과적으로 생성자가 편향을 줄이도록 유도한다.
- 성별 전환 평가(GBET)를 적용하여, 편향 제거된 임베딩이 여전히 성별 연관성을 담고 있는지 테스트한다.
- 현재의 지표와 기법을 비판적으로 평가하며, 낮은 WEAT 점수는 진정으로 편향이 제거된 것을 의미하지 않으며, 후행 모델이 여전히 성별 연관성을 복구할 수 있음을 주장한다.
실험 결과
연구 질문
- RQ1NLP 데이터셋과 모델에서의 주요 편향 원인은 무엇이며, 데이터 수집 및 표현 과정에서 어떻게 기인하는가?
- RQ2민족적 평등, 기회의 평등, 결과의 평등와 같은 다양한 공정성 정의의 형식적 정의는 모델의 행동과 공정성 결과에 어떤 영향을 미치는가?
- RQ3WEAT 및 SEAT와 같은 기존의 편향 측정 지표는 단어 임베딩과 후행 예측에서 편향의 존재를 얼마나 정확하게 반영하는가?
- RQ4왜 현재의 편향 제거 기법들은 메트릭 점수를 낮추더라도 여전히 강건하고 일반화 가능한 공정성을 달성하지 못하는가?
- RQ5인종, 종교, 계급 기반 편향과 같은 비성별 편향을 효과적으로 탐지하고 제거하기 위해 어떤 새로운 방법론적 및 다학문적 접근이 필요한가?
주요 결과
- 역사적 텍스트 코퍼스에서 학습된 단어 임베딩은 사회적 스테레오타입을 반영하고 강화하며, 예를 들어 컴퓨터 과학은 남성과, 간호사와 같은 직업은 여성과 연관지어지는 경향이 있으며, 시간에 따라 사회 운동과의 상관관계로 확인된다.
- 현재의 편향 제거 기법은 WEAT 점수를 낮추기는 하지만, 의미 수준에서의 성별 편향을 여전히 제거하지 못하며, 후행 분류기들이 편향 제거된 벡터에서 성별 연관성을 여전히 복구할 수 있다.
- 편향 제거 후에도 '접수원'이나 '미용사'와 같은 성별 중립적 용어들이 성별에 따라 스테레오타입적으로 연관된 단어들과 여전히 군집되어 있어 의미적 편향이 지속됨을 시사한다.
- 적대적 학습 기법은 생성자가 성별을 드러내지 않도록 훈련시켜 편향을 줄이는 데 잠재력을 보이지만, 모든 후행 작업에서 공정성을 보장하지는 않는다.
- WEAT 및 SEAT와 같은 지표는 편향 탐지에 유용하지만, 진정한 공정성을 나타내는 단독 지표로는 부적절하며, 낮은 점수는 암묵적 편향의 부재를 보장하지 않는다.
- 데이터 부족과 방법론적 과제로 인해 인종, 종교, 계급 기반 비성별 편향에 대한 연구가 극히 부족하여 현재 NLP 공정성 연구에서 중요한 격차를 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.