[论文解读] OPIEC: An Open Information Extraction Corpus
本文介绍了OPIEC,这是迄今为止最大的公开可用开放信息抽取(OIE)语料库,从英文维基百科中使用MinIE和Stanford CoreNLP提取而成。该语料库包含超过3.4亿个三元组,附带丰富的元数据,包括置信度分数、来源信息、句法与语义注释(如空间/时间信息)以及维基百科链接。其主要贡献在于证明OIE捕获了大量知识,尤其是具体、多义以及带有时间/空间标注的事实,这些知识与DBpedia和YAGO等现有知识库互补,仅有5.6%的OIE日期事实与YAGO重叠。
Open information extraction (OIE) systems extract relations and their arguments from natural language text in an unsupervised manner. The resulting extractions are a valuable resource for downstream tasks such as knowledge base construction, open question answering, or event schema induction. In this paper, we release, describe, and analyze an OIE corpus called OPIEC, which was extracted from the text of English Wikipedia. OPIEC complements the available OIE resources: It is the largest OIE corpus publicly available to date (over 340M triples) and contains valuable metadata such as provenance information, confidence scores, linguistic annotations, and semantic annotations including spatial and temporal information. We analyze the OPIEC corpus by comparing its content with knowledge bases such as DBpedia or YAGO, which are also based on Wikipedia. We found that most of the facts between entities present in OPIEC cannot be found in DBpedia and/or YAGO, that OIE facts often differ in the level of specificity compared to knowledge base facts, and that OIE open relations are generally highly polysemous. We believe that the OPIEC corpus is a valuable resource for future research on automated knowledge base construction.
研究动机与目标
- 创建并发布迄今为止最大的公开可用开放信息抽取(OIE)语料库,其数据源为英文维基百科。
- 为每个OIE三元组提供丰富的结构化元数据,包括置信度分数、来源信息、句法与语义注释(例如时间、空间、情态),以及实体链接。
- 分析OIE抽取的事实与DBpedia和YAGO等知识库之间的重叠与互补性,重点关注事实覆盖范围、具体性与多义性。
- 提出OPIEC-Clean,一个经过筛选的子语料库,包含1.04亿个三元组,仅包含概念级论元(命名实体或维基百科链接的概念),以提升下游任务的可用性。
- 证明OIE语料库包含大量高质量知识,这些知识未被传统知识库捕获,尤其体现在时间与空间注释方面。
提出的方法
- 通过将MinIE OIE系统与Stanford CoreNLP处理流水线应用于英文维基百科的全文,构建了OPIEC。
- 每个OIE三元组均被增强为包含来源信息(源句子、位置)、句法注释(词性、词干、依存句法分析)、语义注释(情感极性、情态、归属、空间、时间)以及实体级元数据(NER类型、维基百科链接)。
- 基于模型内部的置信度估计,为每个抽取结果分配置信度分数。
- 通过筛选三元组,仅保留主语和宾语为命名实体、维基百科页面标题或直接链接至维基百科页面的三元组,创建了OPIEC-Clean子语料库。
- 为与知识库进行比较,使用了OPIEC-Linked子语料库(包含580万个三元组,实体已消歧),并通过乐观对齐方式(忽略关系与日期匹配的精确性)识别知识库命中结果。
- 对100个未对齐的三元组进行人工评估,结果显示60%的三元组被正确抽取,对于置信度分数高于0.5的三元组,正确率上升至80%,验证了语料库的质量。
实验结果
研究问题
- RQ1OIE语料库中的知识有多少与DBpedia和YAGO等现有知识库重叠?
- RQ2OIE抽取的事实在具体性、一般性或多义性方面,与结构化知识库中的事实有多大差异?
- RQ3OIE中捕获了多少KB(如YAGO)中缺失的空间与时间信息?
- RQ4OIE在捕获知识库中未包含的事实方面有多有效?此类抽取结果的质量如何?
- RQ5OIE语料库能否作为自动化知识库构建的宝贵且互补的资源?
主要发现
- OPIEC包含超过3.4亿个三元组,是迄今为止最大的公开可用OIE语料库。
- 在YAGO的日期事实中,仅有5.6%的OIE日期事实(645,525个)存在知识库命中,表明传统知识库中存在大量缺失的时间信息。
- 对于YAGO中的空间与时间元事实,仅有2,613个OPIEC-Linked三元组(共13,203个有KB命中)被标注为时间信息,2,629个被标注为空间信息,表明重叠程度有限。
- OPIEC-Linked中未对齐的三元组中,超过一半涉及OPIEC-Clean中关系频率排名前100的主关系,表明OIE捕获了广泛且独特的事实覆盖范围。
- 人工评估显示,随机抽取的未对齐三元组中60%被正确抽取,对于高置信度三元组(分数>0.5)该比例上升至80%,表明尽管存在歧义,语料库仍具有强大的信号质量。
- 本研究证实,OIE语料库包含大量知识,尤其在时间与空间注释方面,与DBpedia和YAGO互补,且通常更具具体性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。