Skip to main content
QUICK REVIEW

[论文解读] Some Languages are More Equal than Others: Probing Deeper into the Linguistic Disparity in the NLP World

Surangika Ranathunga, Nisansa de Silva|arXiv (Cornell University)|Oct 16, 2022
Natural Language Processing Techniques被引用 5
一句话总结

本文通过分析12个语言分类(基于母语者人口和语言活力)的语言资源分布,研究了NLP中的语言不平等现象。研究发现,数据丰富的语言——尤其是具有大规模机构支持的语言——主导了NLP资源,而小型和濒危语言即使在同一语系内也严重缺乏代表性,这归因于与地理位置、GDP和语系相关的系统性偏见。该研究呼吁实现公平的数据整理与包容性的NLP发展,以弥合数字鸿沟。

ABSTRACT

Linguistic disparity in the NLP world is a problem that has been widely acknowledged recently. However, different facets of this problem, or the reasons behind this disparity are seldom discussed within the NLP community. This paper provides a comprehensive analysis of the disparity that exists within the languages of the world. We show that simply categorising languages considering data availability may not be always correct. Using an existing language categorisation based on speaker population and vitality, we analyse the distribution of language data resources, amount of NLP/CL research, inclusion in multilingual web-based platforms and the inclusion in pre-trained multilingual models. We show that many languages do not get covered in these resources or platforms, and even within the languages belonging to the same language group, there is wide disparity. We analyse the impact of family, geographical location, GDP and the speaker population of languages and provide possible reasons for this disparity, along with some suggestions to overcome the same.

研究动机与目标

  • 分析NLP中的语言不平等现象,超越数据可得性,考虑多语言平台和预训练模型中的语言包容性。
  • 探究为何某些语言在同语系或同一地理区域内仍长期处于代表性不足的状态。
  • 识别影响该不平等现象的社会经济与语言因素,如GDP、语系和母语者人口。
  • 提出切实可行的建议,以实现语言资源开发与NLP系统中语言包容性的公平化。
  • 挑战‘仅凭数据可得性即可定义语言在NLP中‘资源丰富程度’’的假设。

提出的方法

  • 本研究采用Ethnologue的12种语言分类体系,依据母语者人口(大型、中型、小型)和语言活力(灭绝、濒危、稳定、机构化)进行划分。
  • 从四个维度评估语言资源的分布:NLP/CL研究产出、多语言网络平台中的语言包容性、多语言预训练模型(如mBERT、XLM-R)中的语言包容性,以及维基百科和Hugging Face上的数据可得性。
  • 作者分析了2021年11月至2022年7月期间Hugging Face和维基百科的数据集增长情况,并按类别规模对数据进行归一化处理,以评估相对进展。
  • 对语言类别的对比分析突出了语系内部和地理区域内的不平衡现象。
  • 研究识别出语言不平等与GDP、地理位置和语系等因素之间的相关性。
  • 对NLP研究人员开展调查,以评估代表性与协作方面的差距,尤其关注东亚地区。

实验结果

研究问题

  • RQ1基于母语者人口和语言活力的语言类别,与实际NLP资源可得性之间的相关性有多大?
  • RQ2为何同一语系或地理区域内的某些语言在NLP资源和模型中的包容性存在显著差异?
  • RQ3在多语言平台(如Facebook)和预训练模型(如mBERT、XLM-R)中,不同语言类别的语言包容性如何比较?
  • RQ4社会经济因素(如GDP和地理位置)在塑造NLP中语言不平等现象方面发挥何种作用?
  • RQ5为何东亚及其他地区语言在公共NLP研究社区和数据集中持续代表性不足?

主要发现

  • 大型机构化语言类别的Hugging Face数据集在2021年11月至2022年7月期间实现了245,941.37%的归一化增长,表明数据增长高度集中于已有丰富资源的语言。
  • 小型灭绝语言和小型濒危语言类别在Hugging Face上未出现数据集增长,归一化增长率为0%,凸显其系统性被忽视。
  • 中型机构化语言和大型机构化语言获得了NLP研究关注和模型包容性的主要部分,而小型语言和濒危语言则基本被忽视。
  • 尽管社区努力推动,濒危语言(如中型濒危语言)的维基百科文章数量实现了1421.19%的归一化增长,表明基层数字保存工作活跃但规模仍不足。
  • 调查发现,东亚研究人员——尤其是中国研究人员——在公共NLP邮件列表和协作网络中代表性严重不足,可能源于语言障碍和封闭的研究社区。
  • 即使在同一语系内,数据可得性和模型包容性也存在显著差异,表明语系归属本身并不能确保公平代表性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。