Skip to main content
QUICK REVIEW

[论文解读] Towards Deep Learning in Hindi NER: An approach to tackle the Labelled Data Scarcity

Vinayak Athavale, Shreenivas Bharadwaj|arXiv (Cornell University)|Oct 31, 2016
Topic Modeling参考文献 8被引用 18
一句话总结

本文提出了一种基于双向LSTM的神经网络模型,用于印地语命名实体识别(NER),通过利用无监督预训练词嵌入,避免了对手工特征、名录或形态分析的依赖。该模型仅使用3,199个标注句子,在ICON 2013印地语NER数据集上实现了77.48%的F1分数,达到当前最先进水平,证明了在结合预训练嵌入的前提下,即使标注数据稀缺,深度学习依然有效。

ABSTRACT

In this paper we describe an end to end Neural Model for Named Entity Recognition NER) which is based on Bi-Directional RNN-LSTM. Almost all NER systems for Hindi use Language Specific features and handcrafted rules with gazetteers. Our model is language independent and uses no domain specific features or any handcrafted rules. Our models rely on semantic information in the form of word vectors which are learnt by an unsupervised learning algorithm on an unannotated corpus. Our model attained state of the art performance in both English and Hindi without the use of any morphological analysis or without using gazetteers of any sort.

研究动机与目标

  • 解决印地语NER中标注数据稀缺的问题,该问题限制了深度学习模型的应用。
  • 开发一种语言无关的NER系统,不依赖于语言特定的特征、名录或基于规则的组件。
  • 评估预训练词嵌入在提升低资源印度语言(如印地语)NER性能方面的有效性。
  • 证明RNN模型,特别是双向LSTM,在无需语言学预处理的情况下,能够很好地泛化到自由词序和屈折复杂的语言。
  • 建立一种可扩展、可迁移的框架,用于低资源印度语言的NER,仅需极少监督。

提出的方法

  • 该模型使用双向LSTM架构,以捕捉每个标记左右两个方向的上下文依赖关系。
  • 词嵌入通过在大规模未标注印地语语料上训练无监督的skip-gram模型来预训练,以捕捉语义和句法关系。
  • 预训练的词嵌入用于初始化LSTM的输入层,从而减少对大规模标注数据集的依赖。
  • 模型在小规模标注数据集上端到端训练,使用交叉熵损失和随机梯度下降优化。
  • 该架构避免了任何手工特征、名录或形态分割,完全依赖于学习到的表示。
  • 性能通过标准NER指标(精确率、召回率和F1分数)在测试集上进行评估。

实验结果

研究问题

  • RQ1深度学习模型是否能在不依赖语言特定特征或名录的情况下,实现强大的印地语NER性能?
  • RQ2无监督预训练词嵌入在提升低资源印度语言NER性能方面有多有效?
  • RQ3与单向RNN或普通LSTM相比,双向LSTM架构在处理印地语的自由词序和形态复杂性方面是否表现更优?
  • RQ4在标注数据有限的情况下,模型深度(单层与双层)对性能的影响有多大?
  • RQ5单一模型架构是否能在不重新设计特征的情况下,泛化到英语和印地语等不同语言?

主要发现

  • 使用GloVe-300词嵌入的所提Bi-LSTM模型在CoNLL 2003英语数据集上未使用任何名录或手工特征,达到了90.32%的F1分数。
  • 在ICON 2013印地语NER数据集上,该模型仅使用3,199个标注句子,F1分数达到77.48%,优于此前不使用名录的方法。
  • 使用GloVe-300词嵌入且仅含一层Bi-LSTM的模型取得了最高性能(开发集78.60%,测试集77.48% F1),表明在数据有限时,更深的网络可能产生过拟合。
  • 双向LSTM显著优于单向RNN和普通LSTM,表明建模前向和后向上下文对NER至关重要。
  • 使用预训练词嵌入初始化的模型性能远超随机初始化的模型,凸显了在低数据环境下语义预训练的重要性。
  • 该模型在英语和印地语NER上均实现了SOTA性能,且未使用任何基于规则的组件、名录或形态分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。