[论文解读] Whose Language Counts as High Quality? Measuring Language Ideologies in Text Data Selection
本文研究了用于筛选大型语言模型训练数据的自动化文本质量过滤器中所嵌入的语言意识形态。通过对美国全国范围的高中报纸文章数据集应用GPT-3质量过滤器,作者发现:来自规模更大、更富裕、教育水平更高的学校——尤其是城市地区的学校——的文本系统性地更受青睐,揭示了尽管与事实准确性或文学质量无关,却仍偏向主流且特权化的语言规范。
Language models increasingly rely on massive web dumps for diverse text data. However, these sources are rife with undesirable content. As such, resources like Wikipedia, books, and newswire often serve as anchors for automatically selecting web text most suitable for language modeling, a process typically referred to as quality filtering. Using a new dataset of U.S. high school newspaper articles -- written by students from across the country -- we investigate whose language is preferred by the quality filter used for GPT-3. We find that newspapers from larger schools, located in wealthier, educated, and urban ZIP codes are more likely to be classified as high quality. We then demonstrate that the filter's measurement of quality is unaligned with other sensible metrics, such as factuality or literary acclaim. We argue that privileging any corpus as high quality entails a language ideology, and more care is needed to construct training corpora for language models, with better transparency and justification for the inclusion or exclusion of various texts.
研究动机与目标
- 调查用于大型语言模型训练的自动化质量过滤器所优先考虑的语言和人口统计特征。
- 评估GPT-3所使用的质量过滤器是否与文本质量的客观指标(如事实准确性、文学声誉或教育水平)一致。
- 揭示数据筛选过程中隐含的语言意识形态,而这些过程通常被视为中立或技术性操作。
- 强调由于存在偏见的筛选标准,导致代表性不足群体的声音在自然语言处理语料库中系统性地被排除。
- 倡导在自然语言处理研究中提升数据筛选流程的透明度、有意识的筛选与文档记录。
提出的方法
- 使用包含1,000篇来自不同地理和经济社会背景的美国高中报纸文章的新数据集,复现了GPT-3质量过滤器。
- 通过补充美国人口普查和国家教育统计中心的数据,将报纸数据集与作者所在社区的人口统计与社会经济指标关联起来。
- 训练并应用了一个文本分类模型,以预测每篇文本是否会被GPT-3过滤器标记为“高质量”。
- 测量过滤器对特定语言和风格特征的偏好,例如句子复杂度、词汇多样性以及主题连贯性。
- 将过滤器的预测结果与外部基准进行比较:新闻来源的事实性评分、标准化考试成绩以及文学奖项。
- 进行社会语言学分析,将过滤器结果与学校规模、邮政编码收入水平、教育水平及城市化程度等人口统计变量关联。
实验结果
研究问题
- RQ1哪些类型的学生写作更可能被GPT-3质量过滤器归类为高质量?
- RQ2该过滤器对质量的评估在多大程度上与事实准确性或文学价值等客观指标相关?
- RQ3作者所在社区的人口统计与社会经济因素如何与过滤器的质量预测相关?
- RQ4自动化文本过滤过程中编码了哪些语言意识形态?它们如何使某些语言规范优于其他有效语言变体?
- RQ5这些数据筛选中的偏见如何导致下游自然语言处理系统中的系统性不公?
主要发现
- GPT-3质量过滤器系统性地偏爱来自规模更大、位于更富裕、教育水平更高及城市地区邮政编码的学校的文章。
- 来自高收入、高教育水平及城市地区的学校的文章,即使在控制了语言复杂度后,也显著更可能被归类为高质量。
- 该过滤器与新闻来源的事实性评分无显著相关性,表明其并未优先考虑事实可靠性。
- 该过滤器也未与文学声誉或标准化考试表现对齐,表明其衡量的是非经验性的“质量”概念。
- 该过滤器的偏好反映出一种语言意识形态,即偏爱标准、正式且学术导向的写作风格,而忽视其他有效的语言变体。
- 结果表明,数据筛选并非中立过程,语言意识形态深刻影响了哪些声音被纳入或排除在大型语言模型之外。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。