[论文解读] "Unsex me here": Revisiting Sexism Detection Using Psychological Scales and Adversarial Samples.
本文提出了一种基于理论的代码本,用于通过心理量表和对抗性样本对性别歧视进行分类,评估不同数据集上的检测方法。研究发现当前模型仅能识别明显的性别歧视,难以泛化至隐蔽或语境相关的形式,凸显了需要采用更广泛、基于理论的方法,以提升自然语言处理系统中性别歧视检测的鲁棒性与包容性。
To effectively tackle sexism online, research has focused on automated methods for detecting sexism. In this paper, we use items from psychological scales and adversarial sample generation to 1) provide a codebook for different types of sexism in theory-driven scales and in social media text; 2) test the performance of different sexism detection methods across multiple data sets; 3) provide an overview of strategies employed by humans to remove sexism through minimal changes. Results highlight that current methods seem inadequate in detecting all but the most blatant forms of sexism and do not generalize well to out-of-domain examples. By providing a scale-based codebook for sexism and insights into what makes a statement sexist, we hope to contribute to the development of better and broader models for sexism detection, including reflections on theory-driven approaches to data collection.
研究动机与目标
- 开发一个全面的代码本,将心理量表条目与社交媒体中现实存在的性别歧视表达对应起来,基于既有的性别歧视理论。
- 评估现有性别歧视检测模型在多种数据集上的表现,评估其鲁棒性与泛化能力。
- 分析人类以最少干预手段消除性别歧视的策略,识别用于最小化文本改动即中和偏见的语言模式与方法。
- 识别当前检测方法的缺陷,特别是其无法捕捉细微或语境依赖的性别歧视形式。
- 倡导基于理论的数据收集与模型开发,以提升自动化性别歧视检测系统的覆盖范围与公平性。
提出的方法
- 改编既有的心理量表条目(用于测量敌意性别歧视与善意性别歧视)以构建结构化的代码本,用于标注社交媒体文本中的性别歧视内容。
- 通过在性别歧视陈述上进行最小化、有针对性的语言修改,生成对抗性样本,以测试模型的鲁棒性并识别其漏洞。
- 在多个数据集上评估多种性别歧视检测模型,比较其在领域内与领域外样本上的表现。
- 分析人工标注的修改版本,提取去除性别歧视的常见策略,如重新表述、消除性别刻板印象或替换刻板语言。
- 利用代码本将性别歧视的理论构念(如性别角色刻板印象、物化)映射到真实文本中的语言特征。
- 将心理学理论的洞见整合到自然语言处理的数据收集与模型评估中,以增强表征的广度与公平性。
实验结果
研究问题
- RQ1心理量表条目如何映射到社交媒体文本中现实存在的性别歧视表达?
- RQ2当前自动化性别歧视检测模型在不同数据集与语境中的泛化能力如何?
- RQ3人类在消除性别歧视时采用的最小语言修改是什么?这些修改揭示了性别歧视语言的何种本质特征?
- RQ4对抗性样本如何暴露现有性别歧视检测模型的弱点?
- RQ5理论驱动的方法在哪些方面可改进性别歧视检测系统的设计与评估?
主要发现
- 当前性别歧视检测模型难以识别细微或语境嵌入的性别歧视形式,仅在明显敌意或明确的陈述上表现最佳。
- 模型在跨领域数据上的泛化能力差,表明其在不同社交媒体语境或语言风格下的鲁棒性有限。
- 对抗性样本显示,对性别歧视陈述进行微小但语义上关键的修改常可逃避检测,凸显模型的脆弱性。
- 人类去除性别歧视的策略通常包括替换性别刻板印象、重新表述权力关系或去除物化语言,表明这些特征对检测至关重要。
- 基于心理量表构建的代码本成功地将性别歧视的理论构念映射到真实文本的语言模式中,为数据标注提供了可复现的框架。
- 迫切需要基于理论的数据收集与模型设计,以提升对在线内容中多样化、细微性别歧视形式的检测能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。