[논문 리뷰] Generating Clues for Gender based Occupation De-biasing in Text
이 논문은 사용자가 지정한 시기와 지리적 범위에서 반대 성별의 실제 역사적 인물들을 검색하여, 텍스트 내 성별 고정관념이 깃든 직업 연관성을 탐지하고 맥락 인식형 반증 자료를 생성하는 인간-기계 협업 시스템을 제시한다. 이 시스템은 글쓰기자와 개발자가 포괄적인 서사와 AI 학습 데이터를 만들 수 있도록 사실 기반의 예시를 제시함으로써 편향을 줄이는 데 기여하며, 직업 성별 규범의 문화적 및 시대적 다양성에 민감하게 반응함을 입증하였다.
Vast availability of text data has enabled widespread training and use of AI systems that not only learn and predict attributes from the text but also generate text automatically. However, these AI models also learn gender, racial and ethnic biases present in the training data. In this paper, we present the first system that discovers the possibility that a given text portrays a gender stereotype associated with an occupation. If the possibility exists, the system offers counter-evidences of opposite gender also being associated with the same occupation in the context of user-provided geography and timespan. The system thus enables text de-biasing by assisting a human-in-the-loop. The system can not only act as a text pre-processor before training any AI model but also help human story writers write stories free of occupation-level gender bias in the geographical and temporal context of their choice.
연구 동기 및 목표
- 일부 직업이 특정 성별과 고정관념적으로 연관되어 있는 텍스트 내 광범위한 성별 편향을 해결하기 위해.
- 서사 텍스트 내 이러한 편향을 식별하고 역사적 자료에서 사실 기반의 반증 자료를 제공하는 시스템을 개발하기 위해.
- 지역 및 시기별로 부족한 성별이 직업에 참여한 사례를 제시함으로써 인간 저자와 AI 개발자가 성별 포용적인 서사와 학습 데이터를 만들 수 있도록 지원하기 위해.
- 직업 성별 규범의 문화적 및 시대적 다양성에 민감한 도구를 만들기 위해, 일률적인 편향 제거를 넘어서기 위해.
제안 방법
- NLP 기법을 사용하여 입력 텍스트를 분석하여 명시된 실체와 그에 연관된 직업을 추출한다.
- 다양한 출처에서 수집한 996개의 직업에 대한 수록된 데이터셋을 기반으로, 직업을 성별 특정 또는 성중립으로 분류한다.
- NLTK 및 CMU 이름 레포지터리를 사용하여 이름을 성별로 매핑하여 명시된 실체의 성별을 추론한다.
- 사용자가 지정한 시간대와 지리적 지역을 기반으로, 동일한 직업을 맡은 반대 성별의 역사적 인물들을 검색하기 위해 DBpedia를 쿼리한다.
- SPARQL 쿼리를 사용하여 이름, 출생 도시, 출생 일자, 사망 일자를 포함한 3개의 튜플을 추출하여 기준에 맞는 여성 또는 남성 인물들을 확보한다.
- 확보한 인물들의 수명 주기와 사용자가 제공한 시간대 간의 시간적 겹침 여부를 확인하여 관련성 확보
실험 결과
연구 질문
- RQ1명시된 실체와 직업의 조합을 바탕으로 서사 텍스트 내 잠재적인 성별 고정관념이 깃든 직업 연관성을 시스템이 탐지할 수 있는가?
- RQ2역사적 자료에서 맥락에 맞는 반증 자료를 어떻게 생성하여 직업 성별 고정관념에 도전할 수 있는가?
- RQ3다른 지리적 지역과 시기 동안 반증 자료의 존재 여부는 어떻게 달라지는가?
- RQ4이러한 시스템은 인간 저자가 서사를 수정하여 직업 성별 편향을 줄이는 데 효과적으로 기여할 수 있는가?
- RQ5시스템의 문화적 및 시대적 맥락에 대한 민감도가 서사 편향 제거에 있어 실용성에 어떤 영향을 미치는가?
주요 결과
- 시스템은 사용자가 정의한 시간과 장소 기반으로 텍스트 내 성별 고정관념이 깃든 직업 연관성을 성공적으로 식별하고, 관련 반증 자료를 역사적 자료에서 확보하였다.
- 미국(1980–2000)의 경우, 여성 의사의 여러 사례를 확보하여 '의사'라는 직업이 이 시기에는 본질적으로 남성 중심으로 간주되지 않음을 입증하였다.
- 미국(1700–1800)의 경우, 관련된 여성 의사가 없었으며, 이는 이 시기 동안 해당 직업이 역사적으로 남성 중심이었음을 시사하며, 시스템의 시기 민감도를 검증하였다.
- 러시아(1980–2000)의 경우에도 여성 의사에 대한 반증 자료를 확보하지 못하여, 해당 지역의 역사적 배경이 이러한 사례의 가용성에 영향을 미쳤음을 시사하였다.
- 동일한 직업이 지리적 및 시기적 맥락에 따라 편향되거나 중립적으로 간주될 수 있음을 시스템이 입증하였으며, 이는 편향 제거 과정에서 맥락 인식의 중요성을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.