Skip to main content
QUICK REVIEW

[论文解读] The Social Dynamics of Language Change in Online Networks

Rahul Goel, Sandeep Soni|arXiv (Cornell University)|Sep 7, 2016
Linguistic Variation and Morphology参考文献 48被引用 6
一句话总结

本研究利用包含600万Twitter用户的大型数据集,将语言变化建模为在线网络中的社会影响,应用参数化霍克斯过程表明,关系强度——尤其是高度嵌入的连接——显著增强了语言采用,特别是语音拼写和“网络用语”缩写,而地理邻近性则起较小作用。

ABSTRACT

Language change is a complex social phenomenon, revealing pathways of communication and sociocultural influence. But, while language change has long been a topic of study in sociolinguistics, traditional linguistic research methods rely on circumstantial evidence, estimating the direction of change from differences between older and younger speakers. In this paper, we use a data set of several million Twitter users to track language changes in progress. First, we show that language change can be viewed as a form of social influence: we observe complex contagion for phonetic spellings and "netspeak" abbreviations (e.g., lol), but not for older dialect markers from spoken language. Next, we test whether specific types of social network connections are more influential than others, using a parametric Hawkes process model. We find that tie strength plays an important role: densely embedded social ties are significantly better conduits of linguistic influence. Geographic locality appears to play a more limited role: we find relatively little evidence to support the hypothesis that individuals are more influenced by geographically local social ties, even in their usage of geographical dialect markers.

研究动机与目标

  • 研究社交网络结构如何影响在线环境中语言创新的传播。
  • 检验特定类型的社交关系(如强关系或地理邻近关系)是否作为语言变化的更强传播渠道。
  • 将语言变化建模为信息扩散的一种形式,使用统计方法量化不同网络特征中的影响。
  • 确定复杂传染(多次接触增加采纳概率)是否适用于不同语言形式,如语音拼写和词汇方言标记。
  • 为大规模社交网络开发一种基于语言事件数据稀疏模式的可扩展参数估计方法。

提出的方法

  • 使用包含600万美国用户公共消息、社交网络关系及地理位置元数据的大规模Twitter数据集(2013年6月至2014年6月),排除转发内容。
  • 采用参数化霍克斯过程将语言采纳建模为点过程,其中事件时间对应用户首次使用某一语言变量的时间。
  • 将两个关键网络特征作为协变量:F3(关系强度,通过相互互动频率衡量)和F4(地理邻近性,基于用户位置的接近程度)。
  • 使用似然比检验比较包含与不包含F3/F4的模型,评估网络特征在解释语言采纳中的统计显著性。
  • 对32种词-特征组合(16个词 × 2个特征)进行多重假设检验,采用Benjamini-Hochberg程序进行校正。
  • 采用稀疏感知参数估计方法,使霍克斯过程模型可扩展至数百万用户的网络,提升计算效率。

实验结果

研究问题

  • RQ1语音拼写和“网络用语”缩写(如'lol'、'hella')是否表现出复杂传染,即多次接触是否显著提高采纳概率?
  • RQ2高度嵌入的社交关系是否比弱关系或随机关系更有效地传播语言创新?
  • RQ3用户之间的地理邻近性是否显著提高语言影响的可能性?
  • RQ4不同类别的语言变量(如非标准词汇项、语音拼写和“网络用语”)在社会影响机制上是否存在差异?
  • RQ5参数化霍克斯过程模型能否有效捕捉并量化社交网络结构对在线网络中实时语言变化的影响?

主要发现

  • 语音拼写和“网络用语”缩写(如'lol'、'hella')表现出复杂传染,多次接触显著提高采纳概率。
  • 高度嵌入的社交关系(高关系强度)在传播语言创新方面显著比弱关系或低嵌入关系更具影响力,支持H1。
  • 仅有三个词——'asl'、'jawn'和'lls'——在加入地理邻近性(F4)后模型拟合显著改善,表明对H2的支持有限。
  • 对于使用次数少于10,000次的词,网络结构特征(F3和F4)无法显著改善模型拟合,因数据不足。
  • 对于七个词——'ard'、'asl'、'cookout'、'hella'、'jawn'、'mfs'和'tfti'——加入关系强度(F3)的霍克斯过程模型显著改善拟合。
  • 本研究表明,语言影响在社交网络中并非均匀分布,而是通过社会对关系强度的评价策略性地中介,暗示在线交流中基于身份的语言选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。