Skip to main content
QUICK REVIEW

[论文解读] Political Text Scaling Meets Computational Semantics

Federico Nanni, Goran Glavašš|arXiv (Cornell University)|Apr 12, 2019
Computational and Text Analysis Methods被引用 6
一句话总结

本文提出 SemScale,一种新颖的无监督文本缩放算法,通过使用分布语义向量替代传统的词袋表示方法,更准确地捕捉文本中的政治意识形态。通过利用词嵌入和基于图的聚类方法,SemScale 显著提升了与真实政治维度的一致性,尤其是在多语言环境中,其在捕捉欧洲议会演讲和政党宣言中的意识形态立场方面优于 Wordfish。

ABSTRACT

During the last fifteen years, automatic text scaling has become one of the key tools of the Text as Data community in political science. Prominent text scaling algorithms, however, rely on the assumption that latent positions can be captured just by leveraging the information about word frequencies in documents under study. We challenge this traditional view and present a new, semantically aware text scaling algorithm, SemScale, which combines recent developments in the area of computational linguistics with unsupervised graph-based clustering. We conduct an extensive quantitative analysis over a collection of speeches from the European Parliament in five different languages and from two different legislative terms, and show that a scaling approach relying on semantic document representations is often better at capturing known underlying political dimensions than the established frequency-based (i.e., symbolic) scaling method. We further validate our findings through a series of experiments focused on text preprocessing and feature selection, document representation, scaling of party manifestos, and a supervised extension of our algorithm. To catalyze further research on this new branch of text scaling methods, we release a Python implementation of SemScale with all included data sets and evaluation procedures.

研究动机与目标

  • 解决传统文本缩放方法仅依赖词频而忽略语义意义的局限性。
  • 开发一种语义感知的文本缩放算法,通过建模词语相似性来更准确地捕捉政治立场。
  • 在多种语言和立法期间对所提方法与既有的基于频率的方法(如 Wordfish)进行性能评估。
  • 证明语义表示在降低对词汇变化敏感性的同时,提升与已知意识形态维度对齐能力的优势。
  • 提供可复现的开源实现,以推动政治科学领域语义文本缩放的进一步研究。

提出的方法

  • 用密集的分布式词嵌入(例如来自 skip-gram 或 CBOW 模型)替换原始词频,以语义方式表示文档。
  • 通过平均每个文档的词嵌入来构建文档表示,从而在减少词汇噪声的同时保留语义内容。
  • 应用无监督的基于图的聚类算法,从未观察到的语义文档表示中推断潜在的政治意识形态位置。
  • 采用确定性、非概率框架,以确保在不同运行中的一致性和可复现性。
  • 通过引入两篇参考文本(例如极左/极右)将 SemScale 扩展至有监督设置,以锚定意识形态量表。
  • 引入政党嵌入,以在语义空间中表示整个政党的竞选宣言,从而实现对大规模宣言集合的可扩展分析。

实验结果

研究问题

  • RQ1与基于频率的方法相比,词语的语义表示是否能提升文本缩放在捕捉已知政治维度方面的准确性?
  • RQ2SemScale 在缩放欧洲议会演讲时,其在多种语言和立法期间的表现如何?
  • RQ3语义信息在在多大程度上降低了对词汇变化的敏感性,同时保持了意识形态对齐?
  • RQ4在弱监督设置下,仅使用两篇参考文本的最小监督是否能显著提升缩放性能?
  • RQ5从语义表示中提取的政党嵌入是否能增强宣言分析的可扩展性和可解释性?

主要发现

  • 当使用 RILE 数据对整个政党竞选宣言进行缩放时,SemScale 与真实右-左意识形态的相关性达到 r = 0.70,高于 Wordfish 的 r = 0.53。
  • 在多语言环境中,SemScale 在捕捉欧盟一体化维度方面始终优于 Wordfish,相关性在五种语言中达到 0.63 至 0.80 之间。
  • 通过仅使用两篇参考文本的 SemScale 有监督扩展版本,与真实值的相关性提升至 r = 0.80(无监督模式下为 r = 0.70),证明了最小监督的价值。
  • 语义缩放减少了对高频词汇的依赖,通过聚焦于语义上有意义的词语(如名词和专有名词)提升了可解释性。
  • 该方法在时间周期和语言之间表现出稳健性,在演讲和宣言数据中均实现了稳定的性能提升,尤其在语义相似但词汇重叠度低的情况下表现更优。
  • SemScale 的 Python 实现、数据集和评估流程的发布,确保了可复现性,并为语义文本缩放的未来研究提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。