Skip to main content
QUICK REVIEW

[论文解读] Formal Ontology Learning from English IS-A Sentences

Sourish Dasgupta, Ankur Padia|arXiv (Cornell University)|Feb 11, 2018
Natural Language Processing Techniques参考文献 61被引用 3
一句话总结

该论文提出DLOL,一种形式化本体学习框架,通过两阶段流程将事实性英语IS-A句子转化为描述逻辑$Δ\mathcal{SHOQ}(\mathbf{D})$:首先利用归一化句子结构(NSS)实现鲁棒的句子归一化,再通过描述逻辑翻译(DLT)算法将句子映射为形式化逻辑。与Text2Onto、FRED和LExO等最先进工具相比,DLOL在词汇准确率上提高21%,在基于实例的推理召回率上提高46%。

ABSTRACT

Ontology learning (OL) is the process of automatically generating an ontological knowledge base from a plain text document. In this paper, we propose a new ontology learning approach and tool, called DLOL, which generates a knowledge base in the description logic (DL) SHOQ(D) from a collection of factual non-negative IS-A sentences in English. We provide extensive experimental results on the accuracy of DLOL, giving experimental comparisons to three state-of-the-art existing OL tools, namely Text2Onto, FRED, and LExO. Here, we use the standard OL accuracy measure, called lexical accuracy, and a novel OL accuracy measure, called instance-based inference model. In our experimental results, DLOL turns out to be about 21% and 46%, respectively, better than the best of the other three approaches.

研究动机与目标

  • 为解决从英语事实性IS-A句子中进行形式化本体学习所面临的非平凡挑战,包括词汇、句法、时态、情态及比较形式的差异。
  • 开发一种鲁棒且对改写不敏感的中间表示,将多样化的句子形式归一化为标准结构。
  • 设计一种描述逻辑翻译算法,将归一化后的句子映射为$Δ\mathcal{SHOQ}(\mathbf{D})$逻辑片段中的等价公理与规则。
  • 在标准与新型基准上评估该框架,证明其在准确性方面优于现有工具。
  • 确立IS-A句子作为非IS-A事实性陈述形式化表示的基础。

提出的方法

  • 提出两阶段流程:首先,归一化句子结构(NSS)将输入的IS-A句子归一化为标准形式,降低对句法与词汇差异的敏感性。
  • 采用模板匹配算法,将多样化的IS-A句子模式(如Hearst模式、时态变化、情态形式等)映射为标准化的NSS实例。
  • 应用描述逻辑翻译(DLT)算法,将NSS中的语言结构映射为$Δ\mathcal{SHOQ}(\mathbf{D})$描述逻辑中的等价公理与规则。
  • 使用基于WCL v1.1语料库构建的黄金标准本体作为评估语义准确率的参考。
  • 引入一种新颖的基于实例的推理度量(IIM),用于评估学习到的本体在词汇匹配之外的推理能力。
  • 采用标准的词汇准确率(LA)与IIM作为评估指标,将DLOL与Text2Onto、FRED和LExO在社区发布的数据集上进行比较。

实验结果

研究问题

  • RQ1形式化本体学习系统是否能在对语言差异具有鲁棒性的同时,实现将英语事实性IS-A句子高精度转化为$Δ\mathcal{SHOQ}(\mathbf{D})$?
  • RQ2所提出的NSS表示在归一化多样化IS-A句子模式方面,相较于现有方法效果如何?
  • RQ3DLT算法在将归一化句子翻译为形式化逻辑公理时,其语义保真度在多大程度上得以保持?
  • RQ4DLOL在词汇准确率与基于推理的性能方面,相较于最先进本体学习工具表现如何?
  • RQ5IS-A句子能否作为通过形式化表示学习非IS-A事实性陈述的基础?

主要发现

  • DLOL在词汇准确率上平均比表现第二好的工具高出21%,优于Text2Onto、FRED和LExO。
  • DLOL在基于实例的推理召回率(IIM)上平均提升46%,表明其具备更优越的推理能力。
  • NSS归一化组件显著降低了IS-A句子在句法与词汇差异上的敏感性,提升了下游翻译的准确性。
  • DLT算法成功将复杂IS-A模式(包括比较形式与情态形式)映射为正确的$Δ\mathcal{SHOQ}(\mathbf{D})$公理,保真度高。
  • 在WCL v1.1语料库与领域特定的YAHOO! BOSS数据集上的评估结果表明,DLOL在多种文本来源下均表现出强鲁棒性。
  • 新颖的IIM基准揭示,与现有工具相比,DLOL更能保持推理关系,表明其具备更强的语义基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。