Skip to main content
QUICK REVIEW

[论文解读] Leipzig Corpus Miner - A Text Mining Infrastructure for Qualitative Data Analysis

Andreas Niekler, Gregor Wiedemann|arXiv (Cornell University)|Jul 11, 2017
Computational and Text Analysis Methods被引用 12
一句话总结

莱比锡语料库挖掘器(LCM)是一种文本挖掘基础设施,将定性内容分析与大规模文本挖掘相结合,使自然语言处理(NLP)非专家也能在大规模语料库上应用高级自然语言处理技术,如主题建模、命名实体识别和监督分类。通过结合基于UIMA的处理流水线与用户友好的界面以及基于MongoDB的无模式存储,LCM支持可复现、可扩展且方法论严谨的分析工作流,已在一项使用350万篇报纸文章的政治科学研究中得到验证,研究主题为新自由主义与后民主制。

ABSTRACT

This paper presents the "Leipzig Corpus Miner", a technical infrastructure for supporting qualitative and quantitative content analysis. The infrastructure aims at the integration of 'close reading' procedures on individual documents with procedures of 'distant reading', e.g. lexical characteristics of large document collections. Therefore information retrieval systems, lexicometric statistics and machine learning procedures are combined in a coherent framework which enables qualitative data analysts to make use of state-of-the-art Natural Language Processing techniques on very large document collections. Applicability of the framework ranges from social sciences to media studies and market research. As an example we introduce the usage of the framework in a political science study on post-democracy and neoliberalism.

研究动机与目标

  • 弥合人文学科和社会科学中非NLP专家在定性内容分析与大规模文本挖掘之间的鸿沟。
  • 通过在大数据上实现集成的、多阶段的分析工作流,克服孤立或手动文本挖掘工具的局限性。
  • 通过系统性地整合NLP技术,支持定性研究中的可复现性、可靠性与方法论严谨性。
  • 通过提供一个尊重领域特定方法论的通用界面,促进跨学科合作,同时利用计算能力。
  • 通过使用最先进的NLP流水线,实现对大规模语料的自动化但可控的处理,从而拓展传统内容分析。

提出的方法

  • LCM使用UIMA架构,将NLP组件(标注器)串联起来处理文本,包括分词、句子边界检测、词性标注、命名实体识别以及多词单位检测。
  • 它集成了OpenNLP、Stanford NER、JRC-Names以及基于Wikipedia的工具用于实体和术语检测,并使用莱比锡语料库集合训练自定义模型。
  • 基于MongoDB的无模式数据存储系统支持灵活的注释处理,允许在无模式约束的情况下动态添加或移除元数据结构。
  • 系统通过ClearTK支持监督学习,支持可配置参数的分类和主题建模工作流。
  • 它实现了主动学习循环,分析师可验证自动分类的文本片段,通过精确率与召回率追踪,迭代优化模型性能。
  • 该框架支持工作流组合,即一个流程的输出(如关键词或主题)可作为后续流程(如文档检索或分类)的输入。

实验结果

研究问题

  • RQ1如何在不需深入NLP专业知识的前提下,系统性地将大规模文本挖掘整合到定性内容分析中?
  • RQ2自动化NLP流水线在多大程度上能提升大规模文本语料定性研究的可靠性和可复现性?
  • RQ3主题建模与关键词提取在政治科学领域特定分析中,如何用于识别和筛选相关文档?
  • RQ4通过主动学习与专家验证,能否实现对新闻文章中论证结构的高精度半自动分类?
  • RQ5将多种NLP技术整合到单一工作流中,如何增强社会科学研究所需的定性探究的深度与广度?

主要发现

  • LCM成功支持了一项关于新自由主义与后民主制的政治科学研究,使用了1946年至2012年间350万篇报纸文章的语料库。
  • 使用36篇新自由主义理论文本构成的参考语料库提取出500个关键词,随后用于从更大语料库中检索出10,000篇潜在相关文档。
  • 对选定子集进行主题建模揭示了主题聚类,使研究者能够过滤掉与核心政策领域无关的文档。
  • 对排名靠前文档的论证结构进行人工注释,促成了一个用于定性编码的分层类别体系的建立。
  • 主动学习流水线实现了对论证性文本部分的高置信度分类,分析师可验证或拒绝预测结果,从而迭代提升模型准确率。
  • 最终分类应用于整个语料库,实现了对类别比例随时间变化的定性解读与定量分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。