Skip to main content
QUICK REVIEW

[论文解读] Distributional Term Set Expansion

Amaru Cuba Gyllensten, Magnus Sahlgren|arXiv (Cornell University)|Feb 14, 2018
Topic Modeling参考文献 6被引用 7
一句话总结

本文使用分布语义模型评估了迭代术语集扩展方法,比较了基于中心性的方法(例如特征中心性、信噪比)与基于主动学习的方法(带线性核和RBF核的简单边缘法)。主要发现是,使用RBF核的简单边缘法在五个术语集和四个分布模型中始终优于其他所有方法,确立了其作为分布语义术语集扩展的最佳实践。

ABSTRACT

This paper is a short empirical study of the performance of centrality and classification based iterative term set expansion methods for distributional semantic models. Iterative term set expansion is an interactive process using distributional semantics models where a user labels terms as belonging to some sought after term set, and a system uses this labeling to supply the user with new, candidate, terms to label, trying to maximize the number of positive examples found. While centrality based methods have a long history in term set expansion, we compare them to classification methods based on the the Simple Margin method, an Active Learning approach to classification using Support Vector Machines. Examining the performance of various centrality and classification based methods for a variety of distributional models over five different term sets, we can show that active learning based methods consistently outperform centrality based methods.

研究动机与目标

  • 评估并比较基于中心性和基于分类的迭代术语集扩展方法在分布语义模型中的性能。
  • 识别在用户标注引导的半自动、交互式过程中扩展术语集的最有效方法。
  • 确定某些扩展方法是否更适用于特定的分布语义模型或术语集类型。
  • 基于实证评估,确立分布语义术语集扩展的最佳实践。

提出的方法

  • 本研究采用迭代术语集扩展方法,用户标注初始种子术语,系统根据分布语义相似性提出新的候选术语。
  • 基于中心性的方法包括质心扩展、特征中心性以及信噪比,这些方法通过术语在向量空间中与种子术语的接近程度对术语进行排序。
  • 基于分类的方法采用简单边缘主动学习方法,结合支持向量机,选择最具信息量的术语进行标注。
  • 评估了简单边缘法的两种变体:线性核与RBF核,两者均使用标注样本训练二分类器以预测新的正样本术语。
  • 使用了四种分布语义模型:因子化PPMI、因子化平滑PPMI、CBOW和SGNS,所有模型均在英国国家语料库上训练,窗口大小为2,向量维度为200。
  • 性能通过在十次随机初始化(每次包含五个正样本和五个负样本种子术语)中每轮迭代平均找到的正样本数量进行衡量。

实验结果

研究问题

  • RQ1在使用分布语义模型的迭代术语集扩展中,哪些方法最常被使用?
  • RQ2在不同分布语义模型中,基于中心性和基于分类的扩展方法之间性能差异如何?
  • RQ3某些扩展方法是否对特定分布语义模型或术语集类型更有效?
  • RQ4是否存在一种方法在不同模型和术语集上始终优于其他方法,从而可作为最佳实践?

主要发现

  • 使用RBF核的简单边缘法在所有五个术语集和所有分布语义模型中,平均每轮迭代找到的正样本数量最多。
  • 在AFINN POS术语集中,使用RBF核的简单边缘法在CBOW模型上平均每轮找到3.25个正样本,在PPMI模型上达到4.27个,优于所有其他方法。
  • 使用线性核的简单边缘法也表现良好,尤其在PPMI和SPMI模型上,但所有情况下均被RBF变体超越。
  • 基于中心性的方法(如质心扩展和信噪比)始终被所有基于分类的方法超越,其中特征中心性表现最弱。
  • SGNS在基于中心性的方法上表现欠佳,但在使用RBF核的简单边缘法上表现良好,表明其表示具有局部噪声但整体结构一致。
  • CBOW在使用线性核的简单边缘法上性能显著下降,表明其向量空间可能存在全局噪声,而RBF核有效缓解了该问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。