[论文解读] German Parliamentary Corpus (GerParCor)
本论文介绍了 GerParCor,这是一个大规模、面向特定语体的德语议会全体会议记录语料库,涵盖奥地利、德国、列支敦士登和瑞士三个世纪的议会记录。该语料库利用 OCR(Tesseract)处理花体字(Fraktur)和扫描文本,采用 spaCy3 进行自然语言处理预处理(分词、词性标注、命名实体识别、依存句法分析),并将完全标注的数据以 UIMA XMI 格式发布,支持政治传播与自然语言处理研究中的时间分辨分析。
Parliamentary debates represent a large and partly unexploited treasure trove of publicly accessible texts. In the German-speaking area, there is a certain deficit of uniformly accessible and annotated corpora covering all German-speaking parliaments at the national and federal level. To address this gap, we introduce the German Parliament Corpus (GerParCor). GerParCor is a genre-specific corpus of (predominantly historical) German-language parliamentary protocols from three centuries and four countries, including state and federal level data. In addition, GerParCor contains conversions of scanned protocols and, in particular, of protocols in Fraktur converted via an OCR process based on Tesseract. All protocols were preprocessed by means of the NLP pipeline of spaCy3 and automatically annotated with metadata regarding their session date. GerParCor is made available in the XMI format of the UIMA project. In this way, GerParCor can be used as a large corpus of historical texts in the field of political communication for various tasks in NLP.
研究动机与目标
- 为德语国家在国家与联邦层面解决缺乏统一可访问、已标注议会语料库的问题。
- 从多个不同国家和时间周期创建一个全面且具有历史深度的德语议会全体会议记录语料库。
- 通过标准化、机器可读且带时间标注的议会文本,支持大规模自然语言处理与政治传播研究。
- 将具有历史意义、通常以扫描件或花体字格式存在的议会记录,转化为结构化、已标注的数字形式。
- 通过 GitHub 开放发布语料库及其处理流程,以确保可复现性与可扩展性。
提出的方法
- 通过各国家及联邦议会的独立 API 或网络爬虫(如可用)获取德国、奥地利、瑞士和列支敦士登的议会全体会议记录。
- 使用 Tesseract OCR 将扫描件或花体字格式的记录转换为机器可读文本。
- 使用 spaCy3 流水线对所有文本进行分词、句子边界检测、词性标注、词干化、命名实体识别、形态分析和依存句法分析。
- 将会议日期、地点、标题、文档 ID 等元数据提取并嵌入每个文档的 UIMA XMI 格式中。
- 使用 UIMA XMI 格式对语料库进行存储与结构化,以支持与自然语言处理工具及数据库的集成。
- 将完整语料库及处理软件发布在 GitHub 上,供公众访问并支持未来扩展。
实验结果
研究问题
- RQ1如何从异构的、通常为扫描件或旧有格式的来源,系统性地构建一个大规模、多语言且具有历史完整性的议会语料库?
- RQ2OCR 与自然语言处理流水线在处理历史德语议会文本(如花体字和低质量扫描件)时,其有效性如何?
- RQ3一个统一、标准化且带时间标注的德语议会辩论语料库,能否支持跨国家与时间周期的比较性政治传播与自然语言处理研究?
- RQ4在创建涵盖多个议会、多种语言和多个历史时期、且标注一致的语料库时,面临哪些技术和方法论挑战?
- RQ5如何使此类语料库在不同自然语言处理工具与研究平台之间实现互操作性与可重用性?
主要发现
- GerParCor 是一个大型、多语言且具有历史广度的德语议会全体会议记录语料库,涵盖四个德语国家,覆盖了三个世纪的政治话语。
- 语料库包含已数字化和 OCR 处理的文本,其中相当大一部分源自扫描的花体字文档,成功通过基于 Tesseract 的 OCR 技术完成转换。
- 所有文档均通过 spaCy3 获得全面的语言学标注,包括分词、词性标注、词干化、命名实体识别、形态分析和依存句法分析。
- 会议日期、文档标题和地点等元数据被自动提取并嵌入 XMI 格式,支持基于时间与语境的分析。
- 语料库以标准化的 UIMA XMI 格式发布,确保与主流自然语言处理与文本分析框架的互操作性。
- 整个语料库及其处理流程托管于 GitHub,支持开放获取、可复现性,并可未来扩展更多议会文档。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。