Skip to main content
QUICK REVIEW

[论文解读] Collective Learning From Diverse Datasets for Entity Typing in the Wild

Abhishek Singh, Amar Prakash Azad|arXiv (Cornell University)|Oct 20, 2018
Topic Modeling参考文献 27被引用 4
一句话总结

本文提出了一种集体学习框架(CLF)用于开放域的实体类型分类,其中在测试时领域和标签集知识均未知。通过从多样化数据集构建统一的分层标签集(UHLS),并使用部分分层损失训练单一神经分类器,CLF 实现了在跨领域细粒度标签上的泛化能力——即使这些标签在任一单一数据集中均未出现——在全面评估中优于专用模型。

ABSTRACT

Entity typing (ET) is the problem of assigning labels to given entity mentions in a sentence. Existing works for ET require knowledge about the domain and target label set for a given test instance. ET in the absence of such knowledge is a novel problem that we address as ET in the wild. We hypothesize that the solution to this problem is to build supervised models that generalize better on the ET task as a whole, rather than a specific dataset. In this direction, we propose a Collective Learning Framework (CLF), which enables learning from diverse datasets in a unified way. The CLF first creates a unified hierarchical label set (UHLS) and a label mapping by aggregating label information from all available datasets. Then it builds a single neural network classifier using UHLS, label mapping, and a partial loss function. The single classifier predicts the finest possible label across all available domains even though these labels may not be present in any domain-specific dataset. We also propose a set of evaluation schemes and metrics to evaluate the performance of models in this novel problem. Extensive experimentation on seven diverse real-world datasets demonstrates the efficacy of our CLF.

研究动机与目标

  • 解决开放域实体类型分类问题,其中测试实例的领域和目标标签集未知,要求模型在多样化数据集之间实现泛化。
  • 开发一种统一框架,实现从多个异构实体类型分类数据集(具有不同领域和标签集)中进行集体学习。
  • 构建统一的分层标签集(UHLS),整合来自多个数据集的细粒度标签,同时保持层级关系。
  • 设计一个单一分类器,能够在所有领域中预测最细粒度的标签,即使这些标签在任何特定领域数据集中均未出现。
  • 提出针对开放域实体类型分类问题的新评估方案和指标,以实现对泛化性能的公平基准测试。

提出的方法

  • 通过汇集并合并七个多样化实体类型分类数据集的标签,利用人工判断建立从粗到细的标签关系,构建统一的分层标签集(UHLS)。
  • 创建从数据集特定标签到 UHLS 节点的一对多标签映射,使不同数据集的标签能在同一层次结构中表示。
  • 使用 UHLS 和标签映射,在合并数据集上训练基于 LSTM 的单一神经网络分类器,采用部分分层损失函数以支持多级标签预测。
  • 应用部分层次感知损失函数(Xu 和 Barbosa, 2018),即使仅提供粗粒度标签,也能通过层次标签结构向后传播监督信号。
  • 使用由全部七个数据集的测试实例合并而成的多领域测试集,评估模型在不同领域和标签类型上的泛化性能。
  • 在训练过程中利用跨数据集的知识流动,实现双向迁移,无需指定源或目标数据集,与传统迁移学习有本质区别。

实验结果

研究问题

  • RQ1一个在多样化实体类型分类数据集上训练的单一模型,能否泛化到预测在任一单一数据集中均未出现的细粒度标签?
  • RQ2统一的分层标签集(UHLS)在支持具有重叠和独特标签集的数据集之间的集体学习方面有多有效?
  • RQ3与模型集成或领域专用模型相比,使用部分分层损失函数的集体学习是否能提升实体类型分类中的零样本泛化能力?
  • RQ4在混合领域(如生物医学、新闻、网络论坛)数据混合训练的模型,能在跨领域测试实例中多大程度上预测细粒度类型?
  • RQ5所提出的评估方案和指标在多大程度上能真实反映模型在开放域实体类型分类场景下的泛化能力?

主要发现

  • 即使在集成模型的最佳场景下评估,CLF 模型在合并测试集上的表现仍优于领域专用模型的孤岛式集成。
  • 模型成功预测了在训练数据中未出现的细粒度标签,例如在 CoNLL 数据集中对 'Wallaby' 预测出 'sports team'(运动队)标签。
  • 模型能泛化到互补数据集的标签:例如,即使 'ADR'(药物不良反应)仅在 CADEC 数据集中出现,模型仍能将其分配给 BC5CDR 数据集中的临床句子。
  • 该框架实现了跨数据集的多向知识流动,无单一源或目标,与标准迁移学习或多任务学习有根本性不同。
  • 与对所有数据集完整标注细粒度标签相比,UHLS 构建仅需四分之一数量级(即少四个数量级)的人工标注工作量。
  • 在七个多样化数据集上的大量实验表明,结合 UHLS 和部分损失的集体学习在开放域实体类型分类基准上实现了更优的泛化性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。