Skip to main content
QUICK REVIEW

[论文解读] Scaling Text with the Class Affinity Model

Patrick O. Perry, Kenneth Benoit|arXiv (Cornell University)|Oct 24, 2017
Authorship Attribution and Profiling被引用 5
一句话总结

本文提出类亲和模型(Class Affinity Model),一种基于概率的文本尺度化框架,用于估计在‘政府’与‘反对派’之间的潜在意识形态立场,而非将文本分类为离散类别。通过建模词语对两极对立立场的亲和度,并使用句子级别的块自抽样方法进行不确定性量化,该方法揭示了爱尔兰达里尔(Dáil)议员之间超越投票记录或政党归属的细微意识形态差异,尤其体现在后座议员和政党领导人之间。

ABSTRACT

Probabilistic methods for classifying text form a rich tradition in machine learning and natural language processing. For many important problems, however, class prediction is uninteresting because the class is known, and instead the focus shifts to estimating latent quantities related to the text, such as affect or ideology. We focus on one such problem of interest, estimating the ideological positions of 55 Irish legislators in the 1991 Dáil confidence vote. To solve the Dáil scaling problem and others like it, we develop a text modeling framework that allows actors to take latent positions on a "gray" spectrum between "black" and "white" polar opposites. We are able to validate results from this model by measuring the influences exhibited by individual words, and we are able to quantify the uncertainty in the scaling estimates by using a sentence-level block bootstrap. Applying our method to the Dáil debate, we are able to scale the legislators between extreme pro-government and pro-opposition in a way that reveals nuances in their speeches not captured by their votes or party affiliations.

研究动机与目标

  • 为解决政治科学中传统文本分类的局限性,即已知的类别标签(如政党或投票)缺乏信息量,转而关注从演讲文本中估计潜在的意识形态立场。
  • 将意识形态定位建模为介于‘政府’与‘反对派’之间的连续潜在特质,而非离散的类别归属。
  • 开发一种方法,利用锚定文本(如领导层演讲)的监督学习,实现尽管存在高度政党纪律,仍能对个别议员演讲进行有意义的尺度化。
  • 通过句子级别的块自抽样方法量化尺度化估计中的不确定性,提升模型的稳健性与可解释性。
  • 通过词语影响分析,并与1991年爱尔兰达里尔辩论的专家政治知识对齐,验证模型结果。

提出的方法

  • 该模型采用受朴素贝叶斯启发的概率框架,基于词语在参考演讲中的共现模式,为每个词语分配对‘政府’或‘反对派’的潜在亲和度得分。
  • 将每位发言人的意识形态立场估计为词语亲和度的加权平均值,权重由其演讲中词语的频率与分布决定。
  • 模型引入句子级别的块自抽样方法,重新抽样句子,以量化估计的尺度化立场中的不确定性。
  • 通过评估每个词语对发言人估计立场的偏移贡献,衡量词语影响,从而验证模型拟合效果。
  • 该方法应用于1991年爱尔兰达里尔辩论演讲,使用领导层演讲作为锚点,校准后座议员的尺度化结果。
  • 模型的简洁性使其具备解析可处理性,并与现有方法(如词典尺度化和Wordscores)建立联系。

实验结果

研究问题

  • RQ1当议员的投票行为可由政党归属完美预测时,如何估计其在立法辩论中的潜在意识形态立场?
  • RQ2仅凭文本在多大程度上能揭示议员之间未被政党标签或投票记录捕捉到的细微意识形态差异?
  • RQ3如何利用重采样技术量化个体发言人意识形态尺度化估计中的不确定性?
  • RQ4哪些词语对发言人估计的意识形态立场影响最大,且能否与专家政治认知相验证?
  • RQ5在缺乏预设政治极性词典的语境下,类亲和模型是否能优于传统词典尺度化方法?

主要发现

  • 类亲和模型成功估计了55名爱尔兰达里尔议员的连续意识形态立场,揭示了即使在同一政党内部,政府与反对派亲和度也存在显著差异。
  • Fianna Fáil党的后座议员表现出低于其政党领导人的政府亲和度,表明其演讲中立场更具批判性或中间性。
  • 三位Fianna Fáil后座议员——Nolan、Cullimore与Cowan——具有极端的政府亲和度得分,其中Cowan后来成为Taoisead,表明其与政党领导层保持一致。
  • 在反对派方面,Fine Gael的Garret FitzGerald与Peter Barry对政府提出了强烈的经济批评,反映出基于政策的反对,而非道德谴责。
  • Labour党TD Pat Rabbitte的反对派亲和度最高,其演讲以对Taoiseach的个人攻击为特征,与专家政治分析一致。
  • 模型的词语影响分析确认,与腐败、绩效及品格相关的术语是意识形态尺度化的关键驱动因素,验证了模型的可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。