[论文解读] Transfer Topic Labeling with Domain-Specific Knowledge Base: An Analysis of UK House of Commons Speeches 1935-2014
本文提出了一种半自动的迁移主题标注方法,利用领域特定的知识库——特别是比较议程项目(CAP)编码手册——自动标注1935–2014年英国下议院演讲的动态主题模型中的主题。该方法在23个主题中的12个上与专家编码者达成良好一致,尤其在农业和福利政策等政策领域表现优异,但在涉及机构特定或身份驱动的主题(如北爱尔兰或程序性治理问题)方面存在局限。
Topic models are widely used in natural language processing, allowing researchers to estimate the underlying themes in a collection of documents. Most topic models use unsupervised methods and hence require the additional step of attaching meaningful labels to estimated topics. This process of manual labeling is not scalable and suffers from human bias. We present a semi-automatic transfer topic labeling method that seeks to remedy these problems. Domain-specific codebooks form the knowledge-base for automated topic labeling. We demonstrate our approach with a dynamic topic model analysis of the complete corpus of UK House of Commons speeches 1935-2014, using the coding instructions of the Comparative Agendas Project to label topics. We show that our method works well for a majority of the topics we estimate; but we also find that institution-specific topics, in particular on subnational governance, require manual input. We validate our results using human expert coding.
研究动机与目标
- 解决大规模政治文本语料中手动主题标注的可扩展性与主观性问题。
- 克服无监督主题建模的局限性,后者在缺乏人工标注的情况下会产生难以解释的主题。
- 开发一种整合领域特定知识(如CAP编码手册)的方法,以自动化主题标注,同时保持可解释性。
- 通过使用随时间演化的动态主题模型,应对长期政治文本中的概念漂移问题。
- 通过与专家人类编码者对比验证该方法的性能,以确保主题标注的可靠性与透明度。
提出的方法
- 对1935–2014年间按年份分组的80年英国下议院演讲应用动态主题建模(DTM),以刻画主题的演变过程。
- 将比较议程项目(CAP)编码手册作为领域特定知识库,将主题关键词映射到预定义的政策类别。
- 实施一种迁移标注机制,基于估计主题与CAP预定义政策代码之间的关键词重叠来分配主题标签。
- 通过计算主题关键词与CAP代码本条目之间的Jaccard相似度,确定标签分配的置信度。
- 使用Fleiss’ Kappa度量专家之间在主题标签上的一致性,并将自动标注结果与人类专家编码进行对比以验证其可靠性。
- 通过将自动标签与专家的第一选择和第二选择进行比较,引入人机协同反馈机制,以评估可靠性并识别模糊或机构特定的主题。
实验结果
研究问题
- RQ1像CAP编码手册这样的领域特定知识库在多大程度上能改善立法文本动态主题模型中的自动主题标注?
- RQ2该迁移标注方法在长期议会演讲语料中捕捉随时间演变的政策主题方面表现如何?
- RQ3在哪些政策领域中,该方法与专家人类编码者达成高度一致?在哪些领域中与专家判断不一致?
- RQ4机构特定或身份驱动的主题(如与北爱尔兰或次国家治理相关的主题)如何挑战自动化标注方法?
- RQ5该方法能否推广至其他政治文本领域,如政党宣言、社交媒体或法律文件,并结合现有的编码框架使用?
主要发现
- 该迁移主题标注方法在23个主题中的12个上与专家编码者达成良好一致,其中农业(#1)和福利政策(#13、#14)的共识最高,Fleiss’ Kappa值超过0.6。
- 对于主题#1(农业),100%的专家与自动方法选择了相同的标签,Jaccard相似度为0.48,Fleiss’ Kappa值为0.78。
- 该方法在银行业(#10)和宏观经济学(#16)等主题上表现出中等到实质性的共识,Fleiss’ Kappa值分别为0.3和0.46,尽管专家之间共识度较低。
- 六个主题在自动方法与专家之间出现完全不一致,包括#23(北爱尔兰),专家始终拒绝算法分配的“公民权利、少数群体问题”标签。
- 该方法在同时包含政策内容与程序性语言的主题(如#18和#22)上表现不佳,关键词同时反映政府运作与立法程序,导致标签模糊。
- 专家常将“政府运作”作为程序性或机构性主题的万能标签,而算法则更准确地识别出政策特定标签,表明在某些复杂混合主题中,算法可能优于人类编码者。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。