Skip to main content
QUICK REVIEW

[论文解读] COS960: A Chinese Word Similarity Dataset of 960 Word Pairs

Junjie Huang, Fanchao Qi|arXiv (Cornell University)|Jun 1, 2019
Natural Language Processing Techniques参考文献 28被引用 10
一句话总结

本文提出了COS960,一个包含960对双语素多词表达(MWEs)的中文词语相似度数据集,由15位母语者标注了真实相似度。该数据集基于HowNet和GloVe嵌入构建,可用于评估中文词语嵌入在语义相似度上的表现,其中CBOW模型在所有配对中取得了最高的相关性(Spearman相关系数ρ = 78.2)。

ABSTRACT

Word similarity computation is a widely recognized task in the field of lexical semantics. Most proposed tasks test on similarity of word pairs of single morpheme, while few works focus on words of two morphemes or more morphemes. In this work, we propose COS960, a benchmark dataset with 960 pairs of Chinese wOrd Similarity, where all the words have two morphemes in three Part of Speech (POS) tags with their human annotated similarity rather than relatedness. We give a detailed description of dataset construction and annotation process, and test on a range of word embedding models. The dataset of this paper can be obtained from https://github.com/thunlp/COS960.

研究动机与目标

  • 为解决现有中文词语相似度数据集中缺乏聚焦于真实相似度而非相关性的不足。
  • 为评估中文多词表达(MWEs)的词语嵌入,特别是双语素复合词,建立一个基准数据集。
  • 通过提供高质量、人工标注的数据集,改进中文分布语义模型的评估。
  • 利用所提出的数据集评估多种预训练词语嵌入模型在中文语义相似度上的表现。

提出的方法

  • 从HowNet中构建了51,034个双语素词语的数据集,按词性(POS)标签(名词、动词、形容词)进行过滤。
  • 通过在每个词性组内配对词语,并基于GloVe嵌入的余弦相似度(范围[0.4, 1.0])进行筛选,生成词语对。
  • 使用30位母语者对960对词语(480对名词、240对动词、240对形容词)进行标注,相似度评分采用0–4分制,基于真实语义相似度。
  • 通过预标注考试、讨论协议以及Krippendorff’s alpha评分者间一致性检验,确保标注质量。
  • 将15位标注者评分的平均值作为每对词语的最终黄金标准相似度分数。
  • 使用皮尔逊相关系数和斯皮尔曼等级相关系数,评估六种词语嵌入模型(Skip-Gram、CBOW、GloVe、CWE、fasttext、cw2vec)与人工评分的相关性。

实验结果

研究问题

  • RQ1现有词语嵌入模型在中文多词表达中对真实语义相似度的捕捉能力如何?
  • RQ2在中文词语相似度任务中,不同词性类别(名词、动词、形容词)的模型性能差距有多大?
  • RQ3使用双语素多词表达在多大程度上能提升中文分布语义评估的准确性?
  • RQ4人类对语义相似度的标注在不同词语对和词性标签之间的一致性如何?
  • RQ5在嵌入中引入子词或字符级信息是否能提升该语义相似度基准上的性能?

主要发现

  • CBOW在COS960上表现最佳,斯皮尔曼等级相关系数达到78.2,比Skip-Gram高出2.1个百分点。
  • 所有六种评估的词语嵌入模型均与人工判断表现出高度相关性,表明其与中文真实语义相似度高度一致。
  • 性能在动词对中最高(CBOW的ρ = 84.8),其次为形容词对(CBOW的ρ = 78.5),名词对最低(CBOW的ρ = 77.0)。
  • 使用斯皮尔曼等级相关系数的评估协议在所有模型中均获得最高分,表明标注具有一致性,尤其在相似度分桶内表现稳定。
  • 该数据集显示,尽管fasttext和cw2vec未专门针对中文训练,但其表现具有竞争力(斯皮尔曼相关系数ρ > 75),表明具有良好的迁移能力。
  • 研究结果与早期观点(如Hill et al., 2015)相矛盾,后者认为词语嵌入难以捕捉真实相似度,而本研究在基于中文MWE的数据集中观察到了高度相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。