Skip to main content
QUICK REVIEW

[论文解读] Scientific Information Extraction with Semi-supervised Neural Tagging

Yi Luan, Mari Ostendorf|arXiv (Cornell University)|Aug 21, 2017
Advanced Text Analysis Techniques参考文献 32被引用 9
一句话总结

该论文提出了一种用于科学信息抽取的半监督神经标注模型,将关键词识别问题建模为序列标注任务,并利用基于图的标签传播与置信度感知的数据选择策略,提升在低资源科学文本上的性能。该方法在2017年SemEval任务10 ScienceIE基准上取得了最先进结果,其中归纳方法相比纯自训练方法最高实现8.6%的相对性能提升。

ABSTRACT

This paper addresses the problem of extracting keyphrases from scientific articles and categorizing them as corresponding to a task, process, or material. We cast the problem as sequence tagging and introduce semi-supervised methods to a neural tagging model, which builds on recent advances in named entity recognition. Since annotated training data is scarce in this domain, we introduce a graph-based semi-supervised algorithm together with a data selection scheme to leverage unannotated articles. Both inductive and transductive semi-supervised learning strategies outperform state-of-the-art information extraction performance on the 2017 SemEval Task 10 ScienceIE task.

研究动机与目标

  • 为解决科学领域中因标注数据稀缺而导致的低资源科学信息抽取挑战。
  • 通过将问题转化为序列标注任务,提升对三类关键词——任务(Task)、过程(Process)和材料(Material)——的抽取性能。
  • 利用大规模未标注科学文献,通过半监督学习提升模型性能。
  • 探究领域内与跨领域未标注数据以及数据选择策略对模型泛化能力的影响。
  • 分析科学关键词分类中的失败模式与特定领域挑战。

提出的方法

  • 使用在ScienceIE数据集中少量标注科学段落上训练的层次化LSTM-CRF神经标注模型。
  • 应用基于图的标签传播方法,通过句子表示的相似性图估计未标注句子的后验概率,实现标签传播。
  • 提出一种置信度感知的训练目标,将低置信度预测视为缺失标签,并在损失计算中对其做边缘化处理。
  • 采用一种数据选择方案(ULM),对高置信度未标注样本进行过滤与优先排序,以纳入训练循环。
  • 同时探索归纳式(自训练)与归纳式(基于图)的半监督学习策略,以提升泛化能力。
  • 利用领域内预训练词向量与字符级嵌入,增强对罕见及领域特异性术语的表征学习能力。

实验结果

研究问题

  • RQ1当标注数据有限时,半监督学习是否能显著提升低资源科学文本中的关键词抽取性能?
  • RQ2在科学信息抽取任务中,归纳式与归纳式半监督学习策略在性能与泛化能力方面如何比较?
  • RQ3使用领域内与跨领域未标注数据对模型性能与鲁棒性有何影响?
  • RQ4置信度感知训练目标与数据选择方案如何影响模型收敛性与标注准确率?
  • RQ5在识别科学关键词时,主要的失败模式与错误模式是什么,特别是针对罕见类别如“Task”?

主要发现

  • 所提出的半监督模型在2017年SemEval任务10 ScienceIE基准上达到最先进性能,优于以往的监督学习与多任务学习方法。
  • 归纳式方法ULM+GraphFeat*相比纯自训练方法实现8.6%的相对性能提升,证明了基于图的标签传播与置信度感知学习的有效性。
  • 归纳式方法ULM+GraphInterp相比自训练实现5.6%的相对性能提升,表明归纳式半监督学习同样能带来显著收益。
  • “Task”类别的性能显著低于“Process”和“Material”类别,主要因其出现频率较低,且使用动词短语形式,更难检测。
  • 与ULM+GraphInterp相比,使用ULM+GraphFeat*时,“Process”与“Material”类别的混淆率分别降低3.5%与3.6%,表明类别判别能力得到提升。
  • 错误分析揭示了常见失败案例:遗漏‘to’之后的动词短语,将通用术语如‘receptors’或形容词如‘neighbouring’错误分类,以及对‘SWE’等模糊术语缺乏足够上下文导致误判。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。