Skip to main content
QUICK REVIEW

[论文解读] iLCM - A Virtual Research Infrastructure for Large-Scale Qualitative Data

Andreas Niekler, Arnim Bleier|arXiv (Cornell University)|May 11, 2018
Computational and Text Analysis Methods参考文献 14被引用 6
一句话总结

iLCM 提出了一种软件即服务(SaaS)虚拟研究基础设施,整合了用于大规模文本分析的莱比锡语料库挖掘器(LCM)以及用于可执行笔记本的开放研究计算(ORC)环境,支持计算社会科学与数字人文领域中非结构化与结构化数据的可重现性混合方法分析。该系统通过图形用户界面(GUI)支持非技术用户,通过基于代码的工作流支持高级用户,并通过中央存储库实现分析工作流的共享与重用。

ABSTRACT

The iLCM project pursues the development of an integrated research environment for the analysis of structured and unstructured data in a "Software as a Service" architecture (SaaS). The research environment addresses requirements for the quantitative evaluation of large amounts of qualitative data with text mining methods as well as requirements for the reproducibility of data-driven research designs in the social sciences. For this, the iLCM research environment comprises two central components. First, the Leipzig Corpus Miner (LCM), a decentralized SaaS application for the analysis of large amounts of news texts developed in a previous Digital Humanities project. Second, the text mining tools implemented in the LCM are extended by an "Open Research Computing" (ORC) environment for executable script documents, so-called "notebooks". This novel integration allows to combine generic, high-performance methods to process large amounts of unstructured text data and with individual program scripts to address specific research requirements in computational social science and digital humanities.

研究动机与目标

  • 解决计算社会科学与数字人文领域中对大规模定性文本数据可扩展、可重现分析日益增长的需求。
  • 弥合使用通用文本挖掘工具的非技术研究人员与需要自定义分析脚本的高级用户之间的差距。
  • 通过集中式可执行笔记本与文档化流程的存储库,实现文本分析工作流的可重现性与可重用性。
  • 通过在单一标准化环境中整合非结构化文本分析与结构化数据处理,支持混合方法研究。
  • 基于先前原型部署的用户反馈,提升易用性并扩展分析能力。

提出的方法

  • 莱比锡语料库挖掘器(LCM)提供基于浏览器的图形用户界面,用于使用标准化文本挖掘方法对大规模文本集合(如新闻语料库)进行预处理与分析。
  • LCM 支持对非结构化文本进行关键词提取、频率与共现分析、命名实体识别以及主题建模。
  • 开放研究计算(ORC)组件使用户能够编写并执行结构化数据的自定义分析脚本,支持交互式笔记本环境。
  • 来自 LCM 或外部来源(如元数据、调查数据)的结构化数据可被导入 ORC 环境,用于统计分析与网络分析。
  • LCM 与 ORC 的集成实现了端到端分析:从原始文本到结构化数据分析,形成单一、可重现的工作流。
  • 中央存储库存储笔记本、数据、结果与文档,以确保研究过程的透明性、共享性与可重用性。

实验结果

研究问题

  • RQ1如何以可重现且可扩展的方式分析来自新闻、社交媒体或议会记录的大规模定性数据?
  • RQ2结合基于图形界面的文本挖掘与基于代码的分析的混合架构,在多大程度上能够支持社会科学研究中不同技术水平的研究人员?
  • RQ3如何整合文本挖掘与结构化数据分析,以支持计算社会科学中的混合方法研究?
  • RQ4在数字人文与社会科学中使用大规模文本分析工具的研究人员,其易用性与方法论需求是什么?
  • RQ5如何通过可执行笔记本与集中式版本控制来增强文本分析工作流的可重现性?

主要发现

  • iLCM 基础设施成功将 LCM 用于大规模文本分析与 ORC 环境用于自定义脚本执行相结合,既保证了广泛的可访问性,又具备高级分析能力。
  • 该系统通过在集中式笔记本存储库中存储完整的分析工作流(包括数据、代码、结果与文档),实现了可重现研究。
  • 诸如维基百科人物传记中的性别偏见分析以及经济政策报道中的主题-人物网络分析等用例,展示了该平台处理复杂现实研究问题的能力。
  • 基于图形界面的 LCM 使非编程用户能够对大规模语料库(如《纽约时报》语料库)执行关键词提取与主题建模等关键文本挖掘任务。
  • ORC 组件使高级用户能够对 LCM 输出中提取的网络结构与主题共现关系进行细粒度分析,支持假设检验与统计验证。
  • 早期原型使用反馈表明,双组件架构能有效支持具有不同计算专业水平的研究人员。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。