[论文解读] SuperSim: a test set for word similarity and relatedness in Swedish
SuperSim 是一个大规模、专家标注的瑞典语词语相似度与关联度测试集,包含 1,360 对词语,由五位标注者分别对每对词语的相似度和关联度进行 0–10 分制评分。该测试集为评估瑞典语词嵌入模型提供了基准,结果显示关联度通常比相似度更容易建模,且在更大语料库(如瑞典语 Gigaword)上进行训练可提升 Word2Vec、fastText 和 GloVe 等模型的性能。
Language models are notoriously difficult to evaluate. We release SuperSim, a large-scale similarity and relatedness test set for Swedish built with expert human judgments. The test set is composed of 1,360 word-pairs independently judged for both relatedness and similarity by five annotators. We evaluate three different models (Word2Vec, fastText, and GloVe) trained on two separate Swedish datasets, namely the Swedish Gigaword corpus and a Swedish Wikipedia dump, to provide a baseline for future comparison. We release the fully annotated test set, code, baseline models, and data.
研究动机与目标
- 为解决瑞典语中相似度与关联度方面缺乏高质量、专家标注的测试集的问题。
- 提供一个标准化的基准,用于评估瑞典语词嵌入模型,其可比性相当于国际数据集(如 SimLex-999 和 WordSim353)。
- 使研究人员能够区分瑞典语词汇语义中的语义相似度与关联度。
- 基于两种不同的瑞典语训练语料(瑞典语 Gigaword 与瑞典语维基百科数据集),使用多种预训练模型(Word2Vec、fastText、GloVe)建立模型性能基线。
- 支持未来在瑞典语词汇语义、词嵌入及语言模型评估方面的研究。
提出的方法
- 通过将英文 SimLex-999 和 WordSim353 数据集中的 1,360 对词语翻译成瑞典语,构建测试集。
- 五位专家独立对每对词语在相似度和关联度两个维度上进行 0–10 分制评分,确保高质量的人工验证判断。
- 完整发布数据集,包括标注结果、代码、基线模型及训练数据,其中模型在瑞典语 Gigaword 语料库和瑞典语维基百科数据集上进行训练。
- 通过计算标注者间一致性来验证结果的一致性,结果显示相似度的一致性高于关联度。
- 基线评估采用在两个语料库上微调的 Word2Vec、fastText 和 GloVe 模型,性能通过在测试集上使用斯皮尔曼等级相关系数进行评估。
- 研究比较了模型在相似度与关联度任务上的表现差异,揭示了模型行为在训练语料规模与模型架构方面的差异。
实验结果
研究问题
- RQ1不同词嵌入模型在新的、专家标注的瑞典语相似度与关联度测试集上的表现如何?
- RQ2与较小的、领域特定的语料库(如维基百科)相比,在更大、更多样化的语料库(如瑞典语 Gigaword)上进行训练,是否能显著提升模型在相似度与关联度任务上的性能?
- RQ3在瑞典语中,相似度与关联度是否为独立的语义维度?模型能否有效捕捉这两者?
- RQ4在瑞典语中,相似度判断与关联度判断的标注者间一致性有何差异?
- RQ5现有模型在多大程度上能够捕捉到词语之间高度相关但不相似,或反之的情况?
主要发现
- SuperSim 测试集包含 1,360 对词语,由五位专家分别标注相似度与关联度,标注者间一致性与国际基准水平相当。
- 关联度被普遍认为比相似度更容易判断,关联度的标注者间一致性更高(kappa ~0.68),高于相似度(kappa ~0.58)。
- 所有模型在更大的瑞典语 Gigaword 语料库上的表现均优于在较小的维基百科数据集上,其中 fastText 在 Gigaword 上对相似度(0.528)和关联度(0.550)均取得最高性能。
- 在维基百科语料库上,GloVe 表现优于 Word2Vec 和 fastText,其在关联度任务上达到最高相关性(0.349),在相似度任务上为 0.365。
- 结果证实,关联度任务通常比相似度任务更容易,所有模型在两个数据集上对关联度的性能均优于相似度。
- 仅有四对词语的相似度得分高于关联度得分,且差异小于 0.6,表明高关联度但低相似度的情况较为常见,反之则不然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。