Skip to main content
QUICK REVIEW

[论文解读] explanation-based learning of data oriented parsing

Khalil Sima’an|ArXiv.org|Aug 20, 1997
Natural Language Processing Techniques参考文献 8被引用 10
一句话总结

本文提出了一种用于数据导向解析(DOP)的基于解释的学习(EBL)方法,通过学习部分解析器来减少解析空间的歧义,从而在消歧之前降低复杂度。通过将这些学习得到的部分解析器与完整解析器结合使用,采用有限状态转换器级联结构,该方法显著减少了过度生成现象,并加快了消歧速度——在实证测试中实现了显著的解析空间压缩,同时覆盖范围损失极小。

ABSTRACT

This paper presents a new view of Explanation-Based Learning (EBL) of natural language parsing. Rather than employing EBL for specializing parsers by inferring new ones, this paper suggests employing EBL for learning how to reduce ambiguity only partially. The present method consists of an EBL algorithm for learning partial-parsers, and a parsing algorithm which combines partial-parsers with existing ``full-parsers". The learned partial-parsers, implementable as Cascades of Finite State Transducers (CFSTs), recognize and combine constituents efficiently, prohibiting spurious overgeneration. The parsing algorithm combines a learned partial-parser with a given full-parser such that the role of the full-parser is limited to combining the constituents, recognized by the partial-parser, and to recognizing unrecognized portions of the input sentence. Besides the reduction of the parse-space prior to disambiguation, the present method provides a way for refining existing disambiguation models that learn stochastic grammars from tree-banks. We exhibit encouraging empirical results using a pilot implementation: parse-space is reduced substantially with minimal loss of coverage. The speedup gain for disambiguation models is exemplified by experiments with the DOP model.

研究动机与目标

  • 通过在消歧之前减小解析空间规模,解决数据导向解析(DOP)中完整解析的高计算成本问题。
  • 实现高效学习部分解析器,使其能够识别并组合句法成分,同时避免生成虚假分析。
  • 将学习得到的部分解析器与现有完整解析器集成,使完整解析器仅负责组合已识别的成分并处理剩余输入部分。
  • 通过减小消歧的搜索空间,优化基于语料库训练的随机语法模型。
  • 证明通过EBL实现的解析空间压缩可带来可测量的DOP消歧速度提升,且覆盖范围损失可忽略。

提出的方法

  • 该方法采用基于解释的学习(EBL)算法,从训练数据中归纳出部分解析器,重点在于识别有效的句法成分。
  • 学习得到的部分解析器以有限状态转换器级联(CFSTs)的形式实现,从而实现高效且确定性的成分识别。
  • 采用混合解析算法,将学习得到的部分解析器输出与完整解析器结合,其中完整解析器仅处理尚未处理或未识别的输入部分。
  • 部分解析器通过预先过滤掉虚假解析,从而限制搜索空间,减少过度生成。
  • 该方法被整合进DOP框架,从而提升基于语料库训练的随机语法模型的效率。
  • 解析流程确保仅由部分解析器识别出的成分才会被纳入完整解析,从而最大限度减少冗余计算。

实验结果

研究问题

  • RQ1基于解释的学习能否有效应用于学习部分解析器,以减少数据导向解析中的歧义?
  • RQ2如何高效地实现并集成部分解析器与完整解析器,以提升解析效率?
  • RQ3通过EBL对解析空间进行预过滤,能在多大程度上减少过度生成,同时保持DOP模型的覆盖能力?
  • RQ4将EBL学习得到的部分解析器与完整解析器结合,能在消歧速度方面带来多大性能提升?
  • RQ5该方法能否用于优化和加速基于语料库训练的现有随机语法规则模型?

主要发现

  • 该方法显著缩小了解析空间规模,大幅减少了过度生成,且未引入虚假分析。
  • 实证结果表明覆盖范围损失极小,说明学习得到的部分解析器具备足够的泛化能力,可处理多样化的输入句子。
  • 将部分解析器与完整解析器集成后,消歧过程实现了可测量的速度提升,尤其在DOP模型中表现显著,实验评估已证实该效果。
  • 使用有限状态转换器级联结构实现了高效且可扩展的成分识别,支持该方法的实际可行性。
  • 该方法为通过在随机解析前约束搜索空间,提供了一种切实可行的机制,用于优化现有消歧模型。
  • 试点实现验证了使用EBL学习部分解析器以提升数据导向解析框架中解析效率的可行性与有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。