Skip to main content
QUICK REVIEW

[论文解读] Evaluation of African American Language Bias in Natural Language Generation

Nicholas Deas, Jessi Grieser|arXiv (Cornell University)|May 23, 2023
Text Readability and Simplification被引用 4
一句话总结

本文通过两种任务——对应句生成和掩码跨度预测——评估了大型语言模型(LLMs)在非裔美国人语言(AAL)上的偏见。利用一个新颖的多语境AAL数据集,作者发现显著的性能差距,表明LLMs在处理AAL时比处理白人主流英语(WME)时表现更差,揭示了生成模型中的方言偏见。

ABSTRACT

We evaluate how well LLMs understand African American Language (AAL) in comparison to their performance on White Mainstream English (WME), the encouraged "standard" form of English taught in American classrooms. We measure LLM performance using automatic metrics and human judgments for two tasks: a counterpart generation task, where a model generates AAL (or WME) given WME (or AAL), and a masked span prediction (MSP) task, where models predict a phrase that was removed from their input. Our contributions include: (1) evaluation of six pre-trained, large language models on the two language generation tasks; (2) a novel dataset of AAL text from multiple contexts (social media, hip-hop lyrics, focus groups, and linguistic interviews) with human-annotated counterparts in WME; and (3) documentation of model performance gaps that suggest bias and identification of trends in lack of understanding of AAL features.

研究动机与目标

  • 调查大型语言模型在理解与生成非裔美国人语言(AAL)方面是否相较于白人主流英语(WME)表现出偏见。
  • 在一项新颖且多样的AAL数据集上,通过两种语言生成任务——对应句生成和掩码跨度预测——评估LLMs的表现。
  • 记录表明方言偏见存在的性能差距,特别是在识别和生成AAL特征(如省略系动词和习惯体be)方面。
  • 提高对伦理风险的认识,包括在监控等场景中的潜在滥用,同时倡导在医疗保健和心理健康等高影响力应用中提升模型的包容性。

提出的方法

  • 从社交媒体、说唱歌词、焦点小组和语言学访谈中收集了新颖的AAL文本数据集,并由人工标注了对应的WME版本。
  • 在对应句生成任务中评估了六个预训练LLMs,要求模型在AAL与WME之间进行翻译,以评估其对方言的理解能力。
  • 应用掩码跨度预测(MSP)任务,测试模型在AAL和WME语境中预测缺失短语的能力。
  • 使用自动指标和人工判断评估模型表现,重点关注准确率和方言特征的保留情况。
  • 进行错误分析,识别出模型在处理AAL句法特征(如省略系动词和体标记)时的系统性失败。
  • 采用基于词典的方法进行毒性评估,避免依赖可能带有偏见的模型,以防止强化现有偏见。

实验结果

研究问题

  • RQ1大型语言模型在生成和理解非裔美国人语言(AAL)方面是否相较于白人主流英语(WME)表现出性能差距?
  • RQ2AAL的哪些具体句法特征(如省略系动词、习惯体be)最常被LLMs误解或错误生成?
  • RQ3LLMs在AAL使用的不同语境下(如社交媒体、音乐、焦点小组)的表现如何变化?
  • RQ4LLMs在AAL与WME之间翻译时,未能保持语义等价性的程度如何?
  • RQ5在监控和高风险应用场景中,LLMs对AAL理解能力更强可能带来哪些伦理影响?

主要发现

  • LLMs在理解与生成AAL方面与WME相比表现出显著的性能差距,所有六种评估模型均持续表现欠佳。
  • 模型频繁无法保留AAL的关键特征,如省略系动词(例如:'she at work')和习惯体be(例如:'he be running'),表明其对方言的理解能力较差。
  • 错误分析显示,模型特别容易将AAL特征过度纠正为WME形式,表明其存在对标准化语言的偏见。
  • 掩码跨度预测任务进一步证实,模型在预测涉及非标准语法和词汇选择的AAL短语时表现困难,尤其在上下文语境复杂时。
  • 在复杂且语境微妙的AAL中(如说唱歌词和焦点小组讨论),性能差距更为显著,因为细微的语言线索承载着重要语义。
  • 本研究指出,当前的评估指标本身可能也包含偏见,因为基于词典和基于模型的测量方法可能将AAL错误分类为有毒或错误,从而强化系统性不平等。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。