Skip to main content
QUICK REVIEW

[论文解读] Disembodied Machine Learning: On the Illusion of Objectivity in NLP

Zeerak Waseem, Smarika Lulz|arXiv (Cornell University)|Jan 28, 2021
Ethics and Social Impacts of AI参考文献 36被引用 9
一句话总结

本文主张,NLP中的客观性是一种幻觉,因为机器学习模型在整个流程中——从数据收集到模型训练——本质上都嵌入了主观的、具身化的选择。它认为去偏见努力从根本上是有限的,因为偏见不可避免且具有系统性,因此主张应拥抱主观的位置性,以更有效地应对社会边缘化问题。

ABSTRACT

Machine Learning seeks to identify and encode bodies of knowledge within provided datasets. However, data encodes subjective content, which determines the possible outcomes of the models trained on it. Because such subjectivity enables marginalisation of parts of society, it is termed (social) `bias' and sought to be removed. In this paper, we contextualise this discourse of bias in the ML community against the subjective choices in the development process. Through a consideration of how choices in data and model development construct subjectivity, or biases that are represented in a model, we argue that addressing and mitigating biases is near-impossible. This is because both data and ML models are objects for which meaning is made in each step of the development pipeline, from data selection over annotation to model training and analysis. Accordingly, we find the prevalent discourse of bias limiting in its ability to address social marginalisation. We recommend to be conscientious of this, and to accept that de-biasing methods only correct for a fraction of biases.

研究动机与目标

  • 批判NLP领域主流话语中将偏见视为可解决、可消除的有限问题的观点。
  • 揭示机器学习中‘客观性’的追求如何掩盖了数据和模型设计中的具身化、政治性选择。
  • 论证去偏见方法仅能纠正系统性偏见的一小部分,因此不足以应对社会边缘化问题。
  • 倡导从去偏见转向反思性、位置意识清晰的机器学习开发,承认政治与社会的具身性。
  • 通过聚焦边缘群体的生活经验与主观性,重新定义NLP中公平性的讨论话语。

提出的方法

  • 应用唐娜·哈拉维的‘上帝视角’概念,批判机器学习中客观性的主张,揭示其本质是去身体化的主观性。
  • 分析数据选择、标注和模型训练如何内在地嵌入社会、文化和政治主观性。
  • 通过NLP中的实例(如词性标注集和词嵌入)说明技术标准如何反映特定的语言和社会假设。
  • 考察迁移学习与多任务学习作为理论上可将语境和作者身份具身化于模型中的机制。
  • 借鉴女性主义科学与技术研究(STS),将偏见重新定义为需持续反思的政治条件,而非需消除的缺陷。
  • 提出以反思性框架取代解决方案主义的偏见应对方式,聚焦研究者自身的主观位置及其后果。

实验结果

研究问题

  • RQ1NLP中客观性的幻觉如何掩盖了数据与模型开发中嵌入的主观、具身化选择?
  • RQ2为何机器学习中的去偏见方法在应对系统性社会边缘化问题时本质上是有限的?
  • RQ3数据与模型设计选择在哪些方面反映并强化了主导的社会地位?
  • RQ4ML研究如何才能从偏见消除的解决方案主义模式,转向以主观位置性和政治意识为基础的模式?
  • RQ5技术成果如词性标注集和词嵌入在嵌入和延续社会偏见方面发挥何种作用?

主要发现

  • 追求机器学习中的客观性是一种政治行为,它偏袒主导的、去身体化的视角,同时掩盖了创造者与数据来源的主观性。
  • NLP模型中的偏见并非可消除的缺陷,而是知识生产具身性与情境性本质的不可避免特征。
  • 去偏见技术(如词嵌入去偏)仍残留性别化与社会结构的痕迹,证明完全消除偏见是不可能的。
  • 即使看似中立的工具(如宾夕法尼亚树库的词性标注集)也反映了主观的语言理论,偏袒特定语言变体而轻视其他。
  • 迁移学习与多任务学习为在模型中具身化语境与作者身份提供了部分路径,但选择纳入哪些视角本身仍具有政治性。
  • 当前关于机器学习中偏见的论述未能充分考虑研究流程中嵌入的权力动态,导致边缘化声音持续被排斥。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。