[논문 리뷰] SWSR: A Chinese Dataset and Lexicon for Online Sexism Detection
이 논문은 Sina Weibo에서 수집한 다중 해상도 레이블(성차별/비성차별, 카테고리, 대상 유형)을 갖춘 중국어 온라인 성차별 탐지용 첫 번째 중국어 데이터셋인 SWSR과 SexHateLex 어휘집을 소개한다. 이는 최신 모델들을 데이터셋에 적용하여 경쟁적인 성능을 달성하고 중국어 NLP 분야에서 성차별 탐지의 기준을 설정하며, 암시적이고 미묘한 성차별을 탐지하는 데 있어 핵심 과제를 드러낸다.
Online sexism has become an increasing concern in social media platforms as it has affected the healthy development of the Internet and can have negative effects in society. While research in the sexism detection domain is growing, most of this research focuses on English as the language and on Twitter as the platform. Our objective here is to broaden the scope of this research by considering the Chinese language on Sina Weibo. We propose the first Chinese sexism dataset -- Sina Weibo Sexism Review (SWSR) dataset --, as well as a large Chinese lexicon SexHateLex made of abusive and gender-related terms. We introduce our data collection and annotation process, and provide an exploratory analysis of the dataset characteristics to validate its quality and to show how sexism is manifested in Chinese. The SWSR dataset provides labels at different levels of granularity including (i) sexism or non-sexism, (ii) sexism category and (iii) target type, which can be exploited, among others, for building computational methods to identify and investigate finer-grained gender-related abusive language. We conduct experiments for the three sexism classification tasks making use of state-of-the-art machine learning models. Our results show competitive performance, providing a benchmark for sexism detection in the Chinese language, as well as an error analysis highlighting open challenges needing more research in Chinese NLP. The SWSR dataset and SexHateLex lexicon are publicly available.
연구 동기 및 목표
- 암시적인 성차별 이외의 성차별 탐지에 특화된 중국어 애너테이션 자원의 부족을 해결하기 위해.
- Weibo 게시글과 사용자 댓글을 포함한 포괄적인 중국어 성차별 데이터셋(SWSR)을 개발하여 맥락 및 메타데이터 정보를 제공하기 위해.
- 성차별적 표현과 관련된 용어를 포함한 대규모 도메인 특화 어휘집(SexHateLex)을 구축하여 탐지 성능을 향상시키기 위해.
- 이진 분류를 넘어서 성차별 유형과 대상의 세분화된 분석을 가능하게 하여, 성차별 유형과 대상에 대한 연구를 지원하기 위해.
- 최신 모델을 활용한 SWSR 데이터셋 기반의 기준을 제공하여 향후 多어 및 cross-lingual 환경에서의 연구를 촉진하기 위해.
제안 방법
- SWSR 데이터셋은 Sina Weibo에서 수집되었으며, 원본 Weibo 게시글, 사용자 댓글, 익명화된 사용자 메타데이터(성별, 위치, 팔로워 수)를 포함한다.
- 다중 수준 애너테이션 체계를 적용: (i) 성차별/비성차별, (ii) 성차별 카테고리(예: 적대적, 선량한), (iii) 대상 유형(예: 여성, 성별 규범).
- 폭력적 표현 및 성별 고정관념어를 포함한 대규모 중국어 어휘집인 SexHateLex를 언어학적 및 맥락적 특징을 보완하여 편성하였다.
- 세부 지침을 제공한 전문 애너테이터들이 데이터셋을 애너테이션하였으며, 상호 애너테이터 일致도를 측정하여 품질을 확보하였다.
- 변환기 기반 아키텍처를 포함한 베이스라인 모델들이 SWSR 데이터셋에 대해 세 분류 작업을 위해 미세조정 및 평가되었다.
- 암시적이고 미묘한 중국어 텍스트 내 성차별을 탐지하는 데 있어 지속적인 과제를 파악하기 위해 오류 분석을 수행하였다.
실험 결과
연구 질문
- RQ1Sina Weibo를 비롯한 중국어 소셜 미디어에서 온라인 성차별은 언어적 패턴과 대상 유형 측면에서 어떻게 나타나는가?
- RQ2다중 해상도 레이블을 적용한 최신 NLP 모델들이 중국어에서 성차별 콘텐츠를 얼마나 잘 탐지할 수 있는가?
- RQ3중국어에서 암시적 또는 선량한 형태의 성차별을 탐지하는 데 있어 핵심 과제는 무엇이며, 이는 모델 성능에 어떤 영향을 미치는가?
- RQ4사용자 메타데이터(예: 성별, 위치)는 중국어 온라인 논의에서 성차별 콘텐츠 생성과 어떤 관련이 있는가?
- RQ5도메인 특화 어휘집(SexHateLex)의 통합이 자원이 제한된 환경에서 성차별 탐지 모델의 성능을 향상시킬 수 있는가?
주요 결과
- SWSR 데이터셋은 1,500개의 애너테이션된 Weibo 게시글과 1,500개의 댓글을 포함하며, 성차별/비성차별, 카테고리, 대상 유형의 세 수준에 걸친 다중 해상도 레이블이 적용되어 있다.
- SexHateLex 어휘집은 폭력적 표현 및 성별 편견 관련 약 1,200개의 중국어 어휘어휘를 포함하여 공격적 언어의 타겟팅 탐지에 기여한다.
- 베이스라인 모델들은 이진 분류에서 F1 점수 0.78, 카테고리 분류에서 0.72, 대상 유형 분류에서 0.69를 기록하여 향후 연구를 위한 기준을 확립하였다.
- 오류 분석 결과, 특히 맥락이 모호하거나 문화적으로 뉘앙스가 있는 경우, 선량한 형태나 간접적인 성차별을 탐지하는 데 지속적인 어려움이 있음을 확인하였다.
- 데이터셋은 성차별 콘텐츠가 종종 문화적으로 특수한 표현과 성별 고정관념에 둘러싸여 있음을 보여주며, 맥락 인식 모델이 필요하다고 제안한다.
- 사용자 메타데이터 분석 결과, 여성 사용자가 성차별적 발언의 주로 대상이 되며, 지역적 차이에 따라 표현 패턴의 다양성이 관찰되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.