Skip to main content
QUICK REVIEW

[论文解读] Evaluating approaches for supervised semantic labeling

Natalia Ruemmele, Yuriy Tyshetskiy|arXiv (Cornell University)|Jan 29, 2018
Data Quality and Management参考文献 6被引用 13
一句话总结

本文提出了一种监督式语义标注框架,通过一种新颖的基于袋装(bagging)的采样技术,解决类别不平衡和标注数据有限的问题,从而生成多样化的训练实例。该框架引入了DINT模型(使用手工设计特征)以及两种深度学习模型(CNN和MLP,使用原始属性值作为输入),在基准数据集上实现了超过80%的平均倒数排名(MRR),其中DINT模型在处理未知或未见语义标签时表现优于最先进水平的DSL系统。

ABSTRACT

Relational data sources are still one of the most popular ways to store enterprise or Web data, however, the issue with relational schema is the lack of a well-defined semantic description. A common ontology provides a way to represent the meaning of a relational schema and can facilitate the integration of heterogeneous data sources within a domain. Semantic labeling is achieved by mapping attributes from the data sources to the classes and properties in the ontology. We formulate this problem as a multi-class classification problem where previously labeled data sources are used to learn rules for labeling new data sources. The majority of existing approaches for semantic labeling have focused on data integration challenges such as naming conflicts and semantic heterogeneity. In addition, machine learning approaches typically have issues around class imbalance, lack of labeled instances and relative importance of attributes. To address these issues, we develop a new machine learning model with engineered features as well as two deep learning models which do not require extensive feature engineering. We evaluate our new approaches with the state-of-the-art.

研究动机与目标

  • 解决监督式语义标注中类别不平衡和标注训练数据不足的挑战。
  • 开发一种稳健的框架,能够识别并标注未映射到任何本体元素的“非期望”属性。
  • 在标准化基准上评估并比较多种机器学习方法——手工特征、深度学习与集成技术。
  • 构建一个开源基准,用于在多样化领域中公平比较语义标注系统。
  • 证明基于字符分布的简单特征工程可实现强大性能,媲美复杂模型。

提出的方法

  • 提出一种基于袋装的采样策略,通过随机子采样属性值生成多个训练实例,提升训练多样性并平衡少数类语义标签。
  • 引入DINT模型,一种使用手工设计语义特征(如名称相似度、取值熵、词汇模式)的多分类器。
  • 设计两种深度学习模型:一种使用填充后的字符序列的CNN,以及一种使用归一化字符频率作为输入特征的MLP。
  • 引入“未知”类别以显式建模未语义映射到本体的属性,提升对未见或非期望属性的鲁棒性。
  • 构建一个标准化基准,包含五个来自不同领域的现实世界数据集,并在相同条件下评估DINT、CNN、MLP以及最先进水平的DSL系统。
  • 采用平均倒数排名(MRR)作为主要评估指标,以评估预测语义标签的排序性能。

实验结果

研究问题

  • RQ1基于袋装的采样技术能否有效缓解监督式语义标注中的类别不平衡与数据稀缺问题?
  • RQ2在性能和特征工程需求方面,手工设计特征(DINT)与深度学习模型(CNN、MLP)相比如何?
  • RQ3当显式建模未映射属性的“未知”类别时,仅在有限标注数据上训练的模型能否实现高性能?
  • RQ4不同模型在具有不同模式复杂度和标签分布的多样化现实世界数据集上的表现如何变化?
  • RQ5在不依赖外部知识库的情况下,仅依靠属性值本身,能在多大程度上促进准确的语义标注?

主要发现

  • 所提出的袋装采样技术通过提升训练多样性并平衡低频语义标签,显著改善了模型性能。
  • 使用手工设计特征的DINT模型在两个基准数据集上实现了超过80%的平均倒数排名(MRR),在处理未知或未见属性时优于最先进水平的DSL系统。
  • 尽管特征工程极少,深度学习模型(CNN与MLP)仍实现了具有竞争力的性能,其中CNN模型仅依赖原始字符序列。
  • 基于属性值字符分布与熵的简单模型取得了优异结果,表明属性值本身对语义标注具有高度信息量。
  • 性能高度依赖于数据源规模与标签分布,在类别不平衡或数据量较小的数据集上,模型表现的方差更高。
  • 开源基准支持公平比较与可扩展性,有助于未来新模型与新数据集的评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。