Skip to main content
QUICK REVIEW

[论文解读] Lightly-supervised Representation Learning with Global Interpretability

Marco A. Valenzuela-Escárcega, Ajay Nagesh|arXiv (Cornell University)|May 29, 2018
Topic Modeling参考文献 8被引用 5
一句话总结

该论文提出 Emboot,一种轻度监督的命名实体分类方法,通过半监督神经网络目标联合学习自定义实体和模式嵌入,利用少量种子样本迭代优化预测。该方法在 CoNLL-2003 和 OntoNotes 上达到最先进性能,同时生成一个按与类别特定平均嵌入距离排序的全局可解释模式决策列表,其准确率与完整模型相当,且具有高度可解释性。

ABSTRACT

We propose a lightly-supervised approach for information extraction, in particular named entity classification, which combines the benefits of traditional bootstrapping, i.e., use of limited annotations and interpretability of extraction patterns, with the robust learning approaches proposed in representation learning. Our algorithm iteratively learns custom embeddings for both the multi-word entities to be extracted and the patterns that match them from a few example entities per category. We demonstrate that this representation-based approach outperforms three other state-of-the-art bootstrapping approaches on two datasets: CoNLL-2003 and OntoNotes. Additionally, using these embeddings, our approach outputs a globally-interpretable model consisting of a decision list, by ranking patterns based on their proximity to the average entity embedding in a given class. We show that this interpretable model performs close to our complete bootstrapping model, proving that representation learning can be used to produce interpretable models with small loss in performance.

研究动机与目标

  • 为解决监督 NLP 中高标注成本的问题,实现在每类仅需少量标注样本的情况下实现有效的信息抽取。
  • 将表示学习的鲁棒性与基于模式的自举方法的可解释性相结合,克服密集嵌入的黑箱特性。
  • 开发一种全局可解释模型,解释整个抽取系统而非仅单个预测,以提升实际应用中的可维护性和可信度。
  • 证明与在可解释模型中使用预训练嵌入相比,自定义嵌入能同时提升性能与可解释性。

提出的方法

  • 该方法采用改进的神经网络语言模型(NNLM)目标,引入半监督组件,使同一类别的实体和模式相互吸引,而不同类别的则相互排斥。
  • 联合训练用于多词实体和 n-gram 模式的自定义 15 维嵌入(实体两侧最多各 4 个词),初始值随机并随训练过程更新。
  • 通过迭代自举循环,每轮根据每类的预测置信度(基于嵌入与类别中心距离)添加最自信的 10 个预测,逐步扩展已知实体和模式集合。
  • 最终的可解释模型以决策列表形式构建,每个模式按其与该类别实体平均嵌入的余弦相似度对每类进行评分。
  • 该方法使用依存关系驱动的词嵌入(300D)作为输入特征,并应用 t-SNE 可视化验证训练过程中实体按类别聚类的效果。
  • 评估在 CoNLL-2003 和 OntoNotes 上进行,每类使用 10 个种子实体,20 个自举轮次,每轮自举过程包含 100 次嵌入训练轮次。

实验结果

研究问题

  • RQ1轻度监督的表示学习方法是否能在保持可解释性的同时,优于现有自举方法在命名实体分类任务上的表现?
  • RQ2与使用预训练嵌入相比,同时为实体和模式学习自定义嵌入是否能提升性能与可解释性?
  • RQ3基于类别中心距离的嵌入相似性生成的全局可解释模式决策列表,是否能匹配完整模型的性能?
  • RQ4基于嵌入相似性的迭代优化过程,与传统的 PMI 基或分类器基的实体提升方法相比有何差异?

主要发现

  • Emboot 在 CoNLL-2003 和 OntoNotes 数据集上均优于三种最先进自举方法——EPB、Gupta 和 Manning(2014)以及标签传播方法。
  • 可解释版本的 Emboot(Emboot int)使用按嵌入接近度排序的模式决策列表,其性能几乎与完整 Emboot 模型持平,证明可解释性并未带来显著性能损失。
  • 基于自定义嵌入的可解释模型(Emboot int)显著优于使用预训练 Levy 和 Goldberg 嵌入的可解释模型(EPB int),证明了任务特定嵌入学习的重要性。
  • 在 CoNLL-2003 上,59% 的 Emboot int 预测由 1 或 2 个模式触发,84% 由 5 个或更少的模式触发,表明模型具有高度稀疏性与可解释性。
  • t-SNE 可视化结果证实,随着训练进行,实体嵌入按类别聚类,验证了模型学习到有意义且类别特定表示的能力。
  • 尽管每类仅使用 10 个种子样本,该方法在基线模型上仍实现一致的性能提升,展现出强大的样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。