Skip to main content
QUICK REVIEW

[论文解读] Measuring Linguistic Diversity During COVID-19

Jonathan Dunn, Tom Coupé|UvA-DARE (University of Amsterdam)|Apr 3, 2021
Linguistics, Language Diversity, and IdentityArts and Humanities参考文献 19被引用 20
一句话总结

本文提出一种基于赫尔芬达尔-赫希曼指数(HHI)的双重差分法,利用新冠疫情隔离期间的旅行限制作为自然实验,校准数字语料库中的语言多样性度量。研究证明,非本地人口(尤其是游客)显著扭曲了社交媒体数据中的语言多样性,且疫情期间观察到的语言多样性变化中,79.3%可归因于这些旅行限制,而非既有的宏观趋势。

ABSTRACT

Computational measures of linguistic diversity help us understand the linguistic landscape using digital language data. The contribution of this paper is to calibrate measures of linguistic diversity using restrictions on international travel resulting from the COVID-19 pandemic. Previous work has mapped the distribution of languages using geo-referenced social media and web data. The goal, however, has been to describe these corpora themselves rather than to make inferences about underlying populations. This paper shows that a difference-in-differences method based on the Herfindahl-Hirschman Index can identify the bias in digital corpora that is introduced by non-local populations. These methods tell us where significant changes have taken place and whether this leads to increased or decreased diversity. This is an important step in aligning digital corpora like social media with the real-world populations that have produced them.

研究动机与目标

  • 通过将疫情作为自然实验,解决数字语言语料库中的偏差问题,特别是非本地偏差。
  • 利用疫情期间真实的人口流动,验证计算的语言多样性度量方法。
  • 识别社交媒体数据中受非本地人口影响最大的国家和语言。
  • 将疫情期间语言多样性变化与既有的宏观趋势(如移民或双语化变化)区分开来。
  • 为用于人口与语言制图的数字语料库提供一种校正非本地偏差的方法论框架。

提出的方法

  • 采用双重差分(DiD)方法,比较2018年、2019年和2020年的语言多样性,以隔离疫情特异性影响。
  • 使用赫尔芬达尔-赫希曼指数(HHI)作为语言多样性的度量标准,HHI越低表示多样性越高。
  • 分析两年期(2018–2020)的地理标记Twitter数据,追踪各国间语言分布的变化。
  • 利用2018年数据建立季节性调整基线,以控制时间波动和季节性变化。
  • 识别在疫情期间(2020年7月至9月)语言多样性发生显著变化的国家,并与疫情前趋势进行比较。
  • 通过比较数据量与经济指标(如GDP、互联网接入)与人口规模和财富水平,校正生产与抽样偏差。
Figure 1: Number of observations per country.
Figure 1: Number of observations per country.

实验结果

研究问题

  • RQ1新冠疫情旅行限制在多大程度上减少了非本地人口对数字语言语料库中语言多样性的影响?
  • RQ2如何将疫情期间的语言多样性变化与既有的宏观趋势(如移民或语言转变)区分开来?
  • RQ3哪些国家和语言因非本地人口的离开而在语言多样性上表现出最显著的变化?
  • RQ4赫尔芬达尔-赫希曼指数(HHI)能否可靠地用于测量并校正社交媒体数据中的非本地偏差?
  • RQ5观察到的语言多样性变化在多大程度上反映了人口构成的变化,而非语言使用行为的变化?

主要发现

  • 在58个疫情期间(2020年7月至9月)语言多样性发生显著变化的国家中,79.3%在2018–2019年基线期并无类似变化,表明这些变化主要源于疫情相关的旅行限制。
  • 在新西兰和澳大利亚,推文中英语所占比例分别从86.26%降至84.13%和89.51%降至87.45%,随着非本地英语游客的离开,西班牙语和葡萄牙语等少数语言变得更加突出。
  • 本研究发现,非本地偏差(尤其是游客带来的影响)显著扭曲了数字语料库中的语言多样性,特别是在游客流入量高的国家(如新西兰和澳大利亚)尤为明显。
  • 基于HHI的语言多样性度量成功捕捉了真实世界的人口流动,验证了其在纠正数字语料库中非本地偏差方面的有效性。
  • 通过人口和经济数据控制了生产和抽样偏差,证实观察到的变化并非源于数据量失衡或基于财富的抽样效应。
  • 该方法成功将疫情特异性变化与更广泛的人口趋势区分开来,表明当利用旅行限制等自然实验时,数字语料库可被校准以真实反映语言多样性。
Figure 2: Geographic distribution of data by region by month.
Figure 2: Geographic distribution of data by region by month.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。