Skip to main content
QUICK REVIEW

[论文解读] Improving Automated Patent Claim Parsing: Dataset, System, and Experiments

Mengke Hu, David Cinciruk|arXiv (Cornell University)|May 5, 2016
Topic Modeling参考文献 19被引用 9
一句话总结

本文提出了一种成本效益高的方法,通过纠正通用NLP工具将词语错误分类为动词的词性(POS)标签,来改进专利权利要求的自动解析。利用来自Amazon Mechanical Turk的众包数据集,作者训练了一个POS标签校正器,提升了解析准确率,使专利主题分类的错误率降低至2.797%,显著低于使用未经修改的NLP工具的基线系统。

ABSTRACT

Off-the-shelf natural language processing software performs poorly when parsing patent claims owing to their use of irregular language relative to the corpora built from news articles and the web typically utilized to train this software. Stopping short of the extensive and expensive process of accumulating a large enough dataset to completely retrain parsers for patent claims, a method of adapting existing natural language processing software towards patent claims via forced part of speech tag correction is proposed. An Amazon Mechanical Turk collection campaign organized to generate a public corpus to train such an improved claim parsing system is discussed, identifying lessons learned during the campaign that can be of use in future NLP dataset collection campaigns with AMT. Experiments utilizing this corpus and other patent claim sets measure the parsing performance improvement garnered via the claim parsing system. Finally, the utility of the improved claim parsing system within other patent processing applications is demonstrated via experiments showing improved automated patent subject classification when the new claim parsing system is utilized to generate the features.

研究动机与目标

  • 解决通用NLP工具在解析专利权利要求时表现不佳的问题,原因在于其语言模型是基于新闻和网络文本训练的,与专利文本的语言特征不匹配。
  • 通过专注于纠正被错误识别为动词的POS标签,降低为专利权利要求训练新语言模型的成本和工作量。
  • 创建并发布一个公开可用的、通过众包方式获取的专利权利要求片段及其校正后POS标签的数据集,供研究使用。
  • 评估改进的解析对下游专利处理任务的影响,特别是主题分类任务。
  • 证明:通过校正POS标签获得的增强依存句法解析,能为机器学习模型提供更优的特征。

提出的方法

  • 通过Amazon Mechanical Turk进行众包数据收集,生成包含专利权利要求片段及其人工校正POS标签的数据集,针对最初被错误分类为动词的词语进行校正。
  • 基于收集的数据集,开发一个基于机器学习的POS标签校正器,用于识别并纠正专利权利要求中错误的动词标签。
  • 将校正后的POS标签集成到Stanford NLP流程中,通过使用校正后的标签重新运行解析器,强制实现更准确的解析。
  • 使用依存句法解析从权利要求中提取句法特征,并比较未经修改的NLP系统与改进后的NLP系统在性能上的差异。
  • 应用从词级、三元组和依存级特征中提取的TF-IDF特征向量,训练并评估支持向量机(SVM)分类器,用于专利主题分类。
  • 系统性地比较使用未经修改的NLP工具与改进后的权利要求解析系统在多种特征组合下的分类错误率。

实验结果

研究问题

  • RQ1在不重新训练整个语言模型的前提下,纠正专利权利要求中被错误识别的动词POS标签,能否显著提升解析准确率?
  • RQ2众包获取的校正POS标签数据集在构建轻量化、可适应的专利权利要求NLP系统方面有多高效?
  • RQ3改进的权利要求解析在多大程度上提升了下游专利处理任务(如主题分类)的性能?
  • RQ4使用改进解析系统提取的依存特征,对分类错误率的定量影响如何?
  • RQ5将改进的依存特征与其他特征类型(如三元组、词袋)结合,是否能获得比使用未经修改的NLP工具更好的分类性能?

主要发现

  • 当仅使用权利要求的依存关系时,改进后的权利要求解析系统将专利主题分类错误率从5.974%降低至4.695%,显示出显著的性能提升。
  • 当权利要求三元组与改进解析系统提取的依存关系结合时,错误率降至2.797%,而使用未经修改的NLP工具提取的依存关系时错误率为3.99%。
  • 将摘要三元组与权利要求三元组及改进系统提取的依存关系结合,错误率降至2.597%,优于使用未经修改的NLP工具提取依存关系时的3.696%。
  • 在多种特征组合下,改进的解析系统始终提供比未经修改的NLP工具更有用的句法特征,表现为更低的错误率。
  • 基于公开发布的数据集训练的POS标签校正器,仅以极低的投入即实现了显著的解析改进,避免了大规模重训练语言模型的需求。
  • 本研究证实,纠正动词POS标签的误分类是一种高度有效且高效的策略,可将通用NLP工具适配于专利权利要求独特的句法结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。