Skip to main content
QUICK REVIEW

[论文解读] Document Retrieval for Large Scale Content Analysis using Contextualized Dictionaries

Gregor Wiedemann, Andreas Niekler|arXiv (Cornell University)|Jul 11, 2017
Advanced Text Analysis Techniques参考文献 14被引用 6
一句话总结

本文提出了一种用于大规模内容分析中文档检索的上下文化词典方法,利用主题模型和共现数据从典范参考文档中生成加权术语词典。该方法通过整合语义上下文,相较于基线术语加权方法提升了检索性能,在基于主题模型的词典与共现匹配下实现了0.861的MAP值。

ABSTRACT

This paper presents a procedure to retrieve subsets of relevant documents from large text collections for Content Analysis, e.g. in social sciences. Document retrieval for this purpose needs to take account of the fact that analysts often cannot describe their research objective with a small set of key terms, especially when dealing with theoretical or rather abstract research interests. Instead, it is much easier to define a set of paradigmatic documents which reflect topics of interest as well as targeted manner of speech. Thus, in contrast to classic information retrieval tasks we employ manually compiled collections of reference documents to compose large queries of several hundred key terms, called dictionaries. We extract dictionaries via Topic Models and also use co-occurrence data from reference collections. Evaluations show that the procedure improves retrieval results for this purpose compared to alternative methods of key term extraction as well as neglecting co-occurrence data.

研究动机与目标

  • 为解决在研究兴趣抽象且无法通过简单关键词查询捕捉时,从大规模文本集合中检索相关文档的挑战。
  • 开发一种利用人工整理的参考文档作为查询构建基础的检索方法,而非依赖孤立的关键术语。
  • 通过共现数据和基于主题模型的词典加权整合上下文信息,提升检索性能。
  • 评估该方法相较于标准术语加权方法(如tf/idf和一元语法匹配)的有效性。
  • 展示该方法在社会科学内容分析中的实用性,特别是识别具有特定意识形态或话语特征的文档。

提出的方法

  • 该方法首先通过在典范参考文档集合上应用潜在狄利克雷分布(LDA)进行半监督词典提取,以识别与主题相关的术语。
  • 词典中术语的权重计算为所有主题中概率的总和,反映每个术语对参考文献集合语义结构的贡献。
  • 从参考文献集合和通用语言语料库中提取共现数据,以建模术语之间的上下文关系。
  • 使用混合相似度度量对文档相关性进行评分,结合一元语法匹配与基于上下文的相似度,由参数α加权。
  • 采用孔多塞方法基于多个检索系统之间的成对比较对候选文档进行排序,选择一组稳健的伪相关文档用于评估。
  • 通过平均平均精度(MAP)和k值精度进行性能评估,并对排名靠前的文档进行人工相关性标注。

实验结果

研究问题

  • RQ1能否通过主题模型和共现数据生成的词典,提升在内容分析中针对抽象、理论性强的研究兴趣的文档检索性能?
  • RQ2与仅使用原始术语频率相比,共现数据的引入如何影响检索质量?
  • RQ3在内容分析任务的检索中,基于主题模型的词典是否优于基于tf/idf的词典?
  • RQ4检索性能在不同排序位置,尤其是在结果列表的低排序位置,具有多大程度的鲁棒性?
  • RQ5在缺乏标准相关性标签的情况下,基于孔多塞方法的共识排序能否有效识别出可靠的伪相关文档集合用于评估?

主要发现

  • 表现最佳的检索系统结合了一元语法匹配与共现匹配,α=14,使用基于主题模型的词典,实现了0.861的平均平均精度(MAP)。
  • 在包含共现数据的情况下,基于主题模型的词典系统优于基于tf/idf的词典系统,MAP分别为0.861与0.823。
  • k值精度评估显示,最佳系统前10篇文档的精度为1.0,而第501位的精度仍保持在0.9,表明在低排序位置也表现出色。
  • 共现数据的使用显著提升了检索质量,仅依赖一元语法匹配的系统精度和MAP值均较低。
  • 基于孔多塞方法选择的伪相关文档集合稳定,共54篇文档,且在多个系统中排名稳健,验证了评估方法的有效性。
  • 该方法表明,基于主题模型和共现数据生成的上下文化词典在内容分析中有效用于检索与抽象或理论性研究兴趣一致的文档。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。