[论文解读] Distantly Supervised Named Entity Recognition using Positive-Unlabeled Learning
该论文提出了一种用于命名实体识别(NER)远程监督的正例-未例(PU)学习框架,仅使用未标注文本和简单的实体词典。通过将NER建模为PU学习问题,该方法在不完整词典的情况下,通过无偏损失估计和基于改进AdaSampling策略的迭代词典扩充,实现了与监督模型相当的鲁棒性能。
In this work, we explore the way to perform named entity recognition (NER) using only unlabeled data and named entity dictionaries. To this end, we formulate the task as a positive-unlabeled (PU) learning problem and accordingly propose a novel PU learning algorithm to perform the task. We prove that the proposed algorithm can unbiasedly and consistently estimate the task loss as if there is fully labeled data. A key feature of the proposed method is that it does not require the dictionaries to label every entity within a sentence, and it even does not require the dictionaries to label all of the words constituting an entity. This greatly reduces the requirement on the quality of the dictionaries and makes our method generalize well with quite simple dictionaries. Empirical studies on four public NER datasets demonstrate the effectiveness of our proposed method. We have published the source code at \url{https://github.com/v-mipeng/LexiconNER}.
研究动机与目标
- 解决大规模人工标注数据不可用时的低资源NER挑战。
- 通过实现从不完整词典匹配中有效学习,减少对高覆盖率、高精度实体词典的依赖。
- 开发一种PU学习方法,即使仅对正例进行部分标注,也能准确估计分类损失。
- 通过迭代式利用模型预测结果扩充词典,提升泛化能力,减轻因覆盖不全带来的偏差。
- 在多个公开NER基准数据集上验证该方法在极小监督设置下的有效性。
提出的方法
- 该方法将词典匹配到的词视为正例(P),其余所有词视为未标注数据(U),将NER建模为PU学习问题。
- 提出一种新颖的PU学习算法,可证明在正例标注反映真实实体分布的前提下,提供对真实风险的无偏且一致的估计。
- 该方法采用重加权的经验风险最小化目标,以纠正因正例标注不完整而引入的偏差。
- 采用改进的AdaSampling策略,通过选择高置信度的未标注预测结果作为新正例,迭代优化词典。
- 从数据中估计正例比例($\pi_p$),用于校准损失函数,提升估计稳定性。
- 该框架在未标注文本上端到端训练,仅依赖词典匹配作为弱监督信号。
实验结果
研究问题
- RQ1仅使用未标注文本和简单实体词典,PU学习框架能否实现具有竞争力的NER性能?
- RQ2在正例标注不完整的情况下,所提出方法是否能提供对真实分类风险的无偏且一致的估计?
- RQ3性能如何随词典质量与规模变化?迭代扩充是否能提升性能?
- RQ4该方法在不同NER数据集和实体类型上的泛化能力如何?
- RQ5该方法对正例比例估计值($\pi_p$)的误差有多大的鲁棒性?
主要发现
- 即使仅使用简单词典,所提方法在CoNLL-2003上的F1分数与多个监督模型相当。
- 在CoNLL (en) 测试集上,使用原始词典时F1总体达到83.13%,使用扩展词典时为82.94%,尽管假阳例增加,性能下降极小。
- 使用估计的$\pi_p$的模型性能与使用真实$\pi_p$的模型几乎完全一致,表明对估计误差具有强鲁棒性。
- 性能随未标注数据量增加而提升,但超过一定数据量后增益减小,表明在独特模式发现方面已趋于饱和。
- 扩展词典虽提升了召回率,但LOC实体的精确率从85.07%降至71.77%,凸显了覆盖范围与质量之间的权衡。
- 采用迭代词典扩充的AdaPU变体在所有实体类型上均表现出一致的性能提升,证实了该适配策略的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。