Skip to main content
QUICK REVIEW

[论文解读] Automatically Neutralizing Subjective Bias in Text

Reid Pryzant, Richard Diehl Martinez|arXiv (Cornell University)|Nov 21, 2019
Topic Modeling参考文献 17被引用 11
一句话总结

本文提出了一项新颖的任务:通过将带有主观偏见的句子自动转化为更客观、中立的版本,实现文本主观偏见的自动中和。研究构建了一个包含18万对偏见-中立句子对的平行语料库,数据源自维基百科编辑记录,并提出了两种序列到序列模型——一种模块化且可解释的模型,一种并发的端到端模型——两者在新闻、百科全书、书籍和政治演讲等领域的真人评估中均表现出色。

ABSTRACT

Texts like news, encyclopedias, and some social media strive for objectivity. Yet bias in the form of inappropriate subjectivity - introducing attitudes via framing, presupposing truth, and casting doubt - remains ubiquitous. This kind of bias erodes our collective trust and fuels social conflict. To address this issue, we introduce a novel testbed for natural language generation: automatically bringing inappropriately subjective text into a neutral point of view ("neutralizing" biased text). We also offer the first parallel corpus of biased language. The corpus contains 180,000 sentence pairs and originates from Wikipedia edits that removed various framings, presuppositions, and attitudes from biased sentences. Last, we propose two strong encoder-decoder baselines for the task. A straightforward yet opaque CONCURRENT system uses a BERT encoder to identify subjective words as part of the generation process. An interpretable and controllable MODULAR algorithm separates these steps, using (1) a BERT-based classifier to identify problematic words and (2) a novel join embedding through which the classifier can edit the hidden states of the encoder. Large-scale human evaluation across four domains (encyclopedias, news headlines, books, and political speeches) suggests that these algorithms are a first step towards the automatic identification and reduction of bias.

研究动机与目标

  • 解决新闻、百科全书和政治演讲等说明性文本中普遍存在的不当主观性问题。
  • 开发一种新的自然语言生成任务,专注于将带有偏见的语言转化为中立视角(NPOV),同时保持语义不变。
  • 创建首个基于真实维基百科编辑记录、遵循中立视角(NPOV)政策的偏见-中立文本对平行语料库。
  • 提出并评估两种用于自动去偏的神经序列到序列模型:一种模块化、可解释的系统,一种并发的端到端系统。
  • 通过可学习的联合嵌入机制,实现可控且透明的去偏,该机制连接检测与生成模块。

提出的方法

  • 构建维基中立语料库(WNC),一个包含18万对偏见-中立句子对的平行数据集,数据来源为执行中立视角(NPOV)政策的维基百科编辑记录。
  • 设计一种模块化、两阶段模型:首先,基于BERT的分类器检测主观词汇(如事实性动词、有偏见的代词、框架术语);其次,一种新型联合嵌入将分类器的输出与编码器的隐藏状态相结合,以引导文本修改。
  • 实现一种并发的端到端模型,利用BERT编码器同时检测主观性并生成中立化文本,采用标记加权损失函数以突出关键修改。
  • 使用去噪自编码目标训练两种模型,并在WNC数据集上进行微调,重点在于保留语义含义的同时消除偏见。
  • 通过联合嵌入机制引入可控机制,允许用户通过注入自定义概率分布来覆盖模型的检测结果,从而针对特定词汇进行重写。
  • 通过大规模真人标注在四个领域(百科全书、新闻标题、书籍、政治演讲)对模型进行评估,衡量流畅度与去偏效果。

实验结果

研究问题

  • RQ1神经序列到序列模型能否有效学习在真实说明性文本中实现主观偏见的中和?
  • RQ2具有可学习联合嵌入的模块化可解释架构与并发端到端模型相比,在性能和可控性方面有何差异?
  • RQ3所提出的模型在多大程度上能减少偏见,同时保持原文的原始语义和流畅度?
  • RQ4通过联合嵌入机制注入的用户控制信号能否有效引导模型对特定词汇进行修改?这种控制是否提升了与人类偏好的对齐?
  • RQ5与当前最先进的风格迁移和机器翻译方法相比,所提出的模型在去偏任务中的表现如何?

主要发现

  • 采用联合嵌入的模块化模型在中和任务上取得了93.52的BLEU得分和46.8%的准确率,优于基线方法(拼接冻结BERT特征)的90.78 BLEU得分和37.57%准确率。
  • 在四个领域的真人评估中,所提模型生成的文本比当前最先进的风格迁移和机器翻译系统更加中立且流畅。
  • 联合嵌入机制实现了可控编辑:用户可针对特定词汇进行重写,支持人机协同优化模型输出。
  • 当用简单拼接替代联合嵌入时,模块化系统的性能显著下降,证明了检测与生成模块之间学习到的、端到端整合的重要性。
  • 维基中立语料库(WNC)包含18万对经标注的句子对,其偏见子类别(如认识论、框架、人口统计)为未来研究提供了宝贵基准。
  • 尽管性能优异,但模型目前仅限于单字词修改,而此类修改仅占数据集中所有修改的约四分之一,表明在处理多词及跨句偏见方面仍有改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。