Skip to main content
QUICK REVIEW

[论文解读] Low-resource Deep Entity Resolution with Transfer and Active Learning

Jungo Kasai, Kun Qian|arXiv (Cornell University)|Jun 17, 2019
Data Quality and Management参考文献 34被引用 17
一句话总结

该论文提出了一种基于深度学习的实体解析方法,结合了迁移学习与主动学习,在低资源环境下实现了最先进性能。通过在高资源数据集上进行预训练,并利用主动学习迭代选择信息丰富的样本,该模型仅使用比以往方法少十分之一的标注数据,即可实现相当或更优的F1分数。

ABSTRACT

Entity resolution (ER) is the task of identifying different representations of the same real-world entities across databases. It is a key step for knowledge base creation and text mining. Recent adaptation of deep learning methods for ER mitigates the need for dataset-specific feature engineering by constructing distributed representations of entity records. While these methods achieve state-of-the-art performance over benchmark data, they require large amounts of labeled data, which are typically unavailable in realistic ER applications. In this paper, we develop a deep learning-based method that targets low-resource settings for ER through a novel combination of transfer learning and active learning. We design an architecture that allows us to learn a transferable model from a high-resource setting to a low-resource one. To further adapt to the target dataset, we incorporate active learning that carefully selects a few informative examples to fine-tune the transferred model. Empirical evaluation demonstrates that our method achieves comparable, if not better, performance compared to state-of-the-art learning-based methods while using an order of magnitude fewer labels.

研究动机与目标

  • 解决标注数据稀缺且获取成本高昂的低资源实体解析挑战。
  • 通过利用高资源源数据集中的迁移学习,克服深度学习模型在实体解析中对大量数据的依赖。
  • 通过选择具有信息性、不确定性和高置信度样本的主动学习方法,提升低资源目标数据集上的模型性能。
  • 开发一种统一的深度学习架构,以在多样化实体解析场景中学习可迁移的、与属性无关的表征。
  • 证明结合迁移学习与主动学习可实现仅需极少人工标注数据的高精度实体解析。

提出的方法

  • 设计一种深度神经网络架构,通过领域自适应从多个高资源源数据集学习可迁移表征。
  • 通过在标注丰富的源数据集上初始化模型并在低资源目标数据集上微调,应用迁移学习。
  • 实施一种基于高置信度预测和不确定预测的主动学习策略,利用分区机制进行样本选择。
  • 以与属性无关的方式为每个属性使用相似性向量,保留实体记录之间的结构信息。
  • 整合不确定性采样与置信度采样,以在主动学习迭代过程中平衡精确率与召回率。
  • 采用对比损失端到端训练模型,以优化低资源环境下的匹配/非匹配分类任务。

实验结果

研究问题

  • RQ1从高资源数据集进行迁移学习是否能提升低资源目标数据集上的深度学习实体解析性能?
  • RQ2主动学习在减少深度ER模型所需标注样本数量方面有多高效?
  • RQ3将迁移学习与主动学习结合是否能在低资源实体解析中优于单独使用任一方法?
  • RQ4深度学习模型能否学习到与属性无关、可迁移的表征,从而在多样化实体解析领域中泛化?
  • RQ5在标签稀缺条件下,所提方法与最先进学习型及非学习型实体解析方法相比,其性能在定量上如何?

主要发现

  • 在DBLP-ACM数据集上,该方法仅使用300个标注样本即达到97.73的F1分数,优于基线模型(后者使用了显著更多的标注数据)。
  • 在主动学习中采用高置信度采样与分区机制,使召回率提升了8.2%(从97.21%提升至97.84%),同时保持了高精确率(97.63%)。
  • 迁移学习与主动学习的结合使所需标注样本数量相比最先进深度学习方法减少了整整一个数量级。
  • 即使标注样本远少于基线方法,该模型在性能上仍可与非深度学习基线(如SVM、随机森林)相当或更优。
  • 分区机制成功识别出更多假阴性样本,与基线主动学习相比,使标注集中误分类样本的比例降低了21.7%。
  • 在多个数据集(DBLP-Scholar、Fodors-Zagats、Zomato-Yelp、Cora)上的实证评估证实,该方法在低资源环境下持续实现性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。