Skip to main content
QUICK REVIEW

[论文解读] Word Embedding for Social Sciences: An Interdisciplinary Survey

Akira Matsui, Emilio Ferrara|arXiv (Cornell University)|Jul 7, 2022
Computational and Text Analysis Methods被引用 4
一句话总结

本综述对社会科学中词嵌入应用提供了全面的分类法,重点关注 word2vec 及相关模型,用于从文本和非文本数据中提取语义表征。它揭示了方法论趋势,警示了相似性度量中的不一致性,并展示了词嵌入如何在定性与定量研究中实现变量构建。

ABSTRACT

To extract essential information from complex data, computer scientists have been developing machine learning models that learn low-dimensional representation mode. From such advances in machine learning research, not only computer scientists but also social scientists have benefited and advanced their research because human behavior or social phenomena lies in complex data. However, this emerging trend is not well documented because different social science fields rarely cover each other's work, resulting in fragmented knowledge in the literature. To document this emerging trend, we survey recent studies that apply word embedding techniques to human behavior mining. We built a taxonomy to illustrate the methods and procedures used in the surveyed papers, aiding social science researchers in contextualizing their research within the literature on word embedding applications. This survey also conducts a simple experiment to warn that common similarity measurements used in the literature could yield different results even if they return consistent results at an aggregate level.

研究动机与目标

  • 记录将词嵌入技术应用于社会科学研究的日益增长趋势,特别是在分析非结构化或非常规数据方面。
  • 通过建立词嵌入使用标准化分类法,解决社会科学应用中方法论不清晰的问题。
  • 识别并讨论超越文本的新兴应用,包括在线社区互动等非文本人类行为数据。
  • 提醒研究者注意词嵌入分析中使用的相似性度量可能存在不一致性,即使聚合结果看起来一致。
  • 通过阐明 word2vec 及相关模型在跨学科研究中如何被有效且严谨地应用,弥合计算机科学与社会科学之间的鸿沟。

提出的方法

  • 开发了一个九标签分类法,用于对社会科学家如何应用词嵌入模型进行分类,重点关注变量定义、参考词和理论基础。
  • 回顾了来自不同社会科学领域的27篇期刊论文和工作论文,根据方法论选择依据该分类法进行分类。
  • 以预训练的 word2vec 模型(如 CBOW、带负采样的 skip-gram)为主要工具,强调其在低维语义表征中的应用。
  • 开展了一个简单实验,比较常见的相似性度量(如余弦相似度、欧几里得距离),并展示尽管聚合结果一致,但在个体层面上结果存在分歧。
  • 应用词嵌入技术从在线社区(如 Reddit 子版块)中推断潜在变量,如党派倾向、情感和人口统计特征,而无需依赖人工标注标签。
  • 强调使用参考词(如“民主党人”和“共和党人”)在非文本语境中定义工作变量,从而实现在语言无关基础上的数据驱动变量构建。

实验结果

研究问题

  • RQ1词嵌入模型,特别是 word2vec,在传统文本分析之外的社会科学各学科中如何被应用?
  • RQ2在社会科学研究中,用于构建研究变量的词嵌入使用中,出现了哪些方法论模式?
  • RQ3尽管在聚合层面表现一致,常见于词嵌入分析中的相似性度量在个体层面上是否能产生一致结果?
  • RQ4词嵌入模型如何被调整以从在线社区的非文本或间接行为数据中推断社会特征(如党派倾向、性别、年龄)?
  • RQ5在定性和跨学科社会科学研究中应用词嵌入时,面临的主要挑战和局限性是什么?

主要发现

  • 词嵌入模型在社会科学中日益广泛应用——不仅在金融、管理科学等定量领域,也在历史、文化研究和政治科学等定性领域中得到应用。
  • 一个显著趋势是通过参考词(如 Reddit 上的“民主党人”和“共和党人”)间接定义研究变量,从而实现在语言无关基础上的数据驱动、语言独立的变量构建。
  • 本研究揭示,即使在聚合层面结果一致,余弦相似度和欧几里得距离等相似性度量在个体层面上仍可能产生分歧,凸显了关键的方法论风险。
  • 应用已超越文本,可从非文本行为数据(如在线社区中的用户活动模式)中推断社会特征,展示了词嵌入在捕捉社会现象方面的多功能性。
  • 本综述开发的分类法识别出重复出现的方法论模式,包括使用预训练模型、基于参考词的变量定义,以及聚类或预测任务,可为未来的研究设计提供指导。
  • 尽管应用广泛,许多社会科学论文未明确说明其使用的是 CBOW 还是 skip-gram 模型,表明在报告词嵌入应用时,亟需提高方法论透明度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。