[논문 리뷰] Social Biases in NLP Models as Barriers for Persons with Disabilities
이 논문은 NLP 모델이 장애를 가진 사람들을 대상으로 측정 가능한 사회적 편견을 보이며, 특히 독성 및 감성 분류에서 권장되는 장애 관련 용어가 비례적으로 독성 또는 부정으로 분류된다는 것을 입증한다. 연구는 모델 임베딩과 후행 분류기 내에서 유해한 사회적 고정관념이 내재되어 있음을 드러내며, 정신질환, 귀머거리, 실명과 같은 표현에서 특히 두드러진다. 이는 이러한 편견을 완화하기 위해 포괄적인 설계와 장애 공동체의 참여가 필요함을 시사한다.
Building equitable and inclusive NLP technologies demands consideration of whether and how social attitudes are represented in ML models. In particular, representations encoded in models often inadvertently perpetuate undesirable social biases from the data on which they are trained. In this paper, we present evidence of such undesirable biases towards mentions of disability in two different English language models: toxicity prediction and sentiment analysis. Next, we demonstrate that the neural embeddings that are the critical first step in most NLP pipelines similarly contain undesirable biases towards mentions of disability. We end by highlighting topical biases in the discourse about disability which may contribute to the observed model biases; for instance, gun violence, homelessness, and drug addiction are over-represented in texts discussing mental illness.
연구 동기 및 목표
- NLP 모델이 장애를 가진 사람들을 향한 사회적 편견을 내재하고 및 지속시키는지 조사하기.
- 장애에 대한 다양한 언어적 표현 방식—권장된 것과 비권장된 것—이 모델 출력에 어떤 영향을 미치는지 검토하기.
- 정신질환, 무주택자, 약물 중독과 관련된 논의에서 데이터 수준의 편견이 모델 행동을 어떻게 형성하는지 분석하기.
- 온라인 플랫폼과 자동화 시스템에서 장애를 가진 사람들을 대상으로 한 모델 편견의 사회기술적 영향을 부각하기.
- 장애 공동체의 참여를 포함한 포괄적인 모델 개발을 통해 NLP에서의 능력주의적 편견을 해결할 것을 촉구하기.
제안 방법
- 퍼터베이션 기반 평가: 문장 내 대명사를 장애 관련 표현으로 대체하여 모델 점수의 변화를 측정하기.
- 두 가지 사전 훈련된 모델—독성 예측을 위한 Perspective API와 감성 분류기—를 사용하여 모델 출력의 정량적 분석 수행.
- 장애 관련 용어의 의미적 표현에서 편견을 탐지하기 위해 신경망 단어 임베딩 분석 수행.
- 공개된 Reddit 코퍼스를 분석하여 정신질환 및 관련 질환에 대한 논의에서 주제적 편견을 식별하기.
- 장애 권익 단체의 지침에 기반하여 장애 관련 표현을 '권장됨' 또는 '비권장됨'으로 분류하기.
- 장애 유형별로 권장된 표현과 비권장된 표현 간 평균 점수 차이를 비교하여 편견 강도 평가하기.
실험 결과
연구 질문
- RQ1NLP 모델은 독성 및 감성 분류에서 장애 언급에 대해 측정 가능한 편견을 보이는가?
- RQ2권장된 표현과 비권장된 표현 방식이 장애에 대한 모델 예측에 어떤 영향을 미치는가?
- RQ3정신질환, 무주택자, 약물 중독에 대한 논의에서 데이터 수준의 편견이 모델 편견에 어느 정도 기여하는가?
- RQ4단어 임베딩에서의 편견은 사회적 태도가 장애를 가진 사람들을 어떻게 반영하고 강화하는가?
- RQ5이러한 모델 편견이 온라인 커뮤니케이션과 자동화 시스템에서 장애를 가진 사람들의 실제 삶에 어떤 영향을 미치는가?
주요 결과
- 장애를 가진 사람을 언급하는 문장의 독성 점수는 중립적 또는 비장애 관련 참조보다 유의미하게 높았으며, '정신질환 환자'는 Perspective API에서 0.62로 평가되었다.
- 권장된 표현인 '귀머거리'는 중립적 참조인 '키가 큰 사람'보다 독성 점수(0.44)가 높았으며, 이는 체계적 편견을 시사한다.
- 장애 관련 표현의 감성 점수는 중립적 참조보다 항상 더 부정적이었으며, '실명 환자'는 평균 -0.39로 평가되었다.
- 신경망 단어 임베딩은 측정 가능한 편견을 보였으며, 장애 관련 용어가 의미 공간의 부정적 또는 낙인된 영역에 집중되어 있음을 보여주었다.
- 공개 코퍼스에서 정신질환에 대한 논의는 총기 폭력, 무주택자, 약물 중독 등 관련 맥락에서 과도하게 강조되어 있어, 모델 편견의 원인을 설명할 수 있다.
- 편견 강도는 장애 유형에 따라 달라졌으며, 정신질환과 신체적 장애에서 비장애인 참조보다 더 강한 부정적 연관성이 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.