QUICK REVIEW
[论文解读] Simulating Lexical Semantic Change from Sense-Annotated Data
Dominik Schlechtweg, Sabine Schulte im Walde|arXiv (Cornell University)|Jan 9, 2020
Language and cultural evolution参考文献 41被引用 15
一句话总结
本文提出一种新颖方法,利用共时语义标注数据模拟词汇语义变化(LSC),通过利用多义性模式生成更真实的合成数据集。通过将语义频率划分为两个分布以建模语义增益/损失,作者构建了一个大规模、高质量的评估数据集,使LSC检测模型的严格基准测试成为可能,结果显示,与频率和多义性基线相比,模型在分级和二元变化评分上均表现更优。
ABSTRACT
We present a novel procedure to simulate lexical semantic change from synchronic sense-annotated data, and demonstrate its usefulness for assessing lexical semantic change detection models. The induced dataset represents a stronger correspondence to empirically observed lexical semantic change than previous synthetic datasets, because it exploits the intimate relationship between synchronic polysemy and diachronic change. We publish the data and provide the first large-scale evaluation gold standard for LSC detection models.
研究动机与目标
- 解决当前缺乏大规模、可靠的LSC检测模型评估数据的问题。
- 通过利用共时多义性与历时变化之间的关联,开发更真实的LSC评估合成数据集。
- 基于语义频率变化,定义并操作化分级和二元LSC的概念。
- 提供用于评估LSC检测模型的黄金标准,涵盖分级和二元变化评分。
- 实现超越简单频率或多义性基线的模型基准测试,确保更具意义的性能比较。
提出的方法
- 使用语义标注语料库(如SemCor)提取多义词的共时语义分布。
- 将语义标注数据划分为两个语料库,以模拟历时语义频率变化,代表旧的和新的词语使用模式。
- 将分级LSC定义为语义频率分布变化幅度的度量,将二元LSC定义为语义增益或损失的存在与否。
- 对两个语料库中的词表示应用相似性度量(CD、LND、SVD、SGNS)和对齐技术(OP、WI),以预测变化评分。
- 使用Spearman等级相关系数评估分级变化,使用平均精度(AP)评估二元变化,与黄金标准评分进行对比。
- 通过与基线(频率、多义性、随机)对比验证模型性能,以评估模型是否捕捉到频率或多义性变化之外的信息。
实验结果
研究问题
- RQ1如何从共时语义标注数据中模拟词汇语义变化,使其反映真实的历时模式?
- RQ2如何从语义频率分布中推导出分级和二元LSC的定量定义?
- RQ3LSC检测模型在大规模合成黄金标准上的表现如何,相较于频率和多义性基线?
- RQ4模型在多大程度上检测到超越简单频率或多义性变化的语义变化?
- RQ5所提出的模拟方法能否生成比以往合成数据集更真实的评估基准?
主要发现
- 所提出的模拟方法生成的合成LSC数据更好地反映了经验观察到的变化,通过建模源自共时多义性的语义频率变化实现。
- 表现最佳的模型——SGNS结合正交Procrustes对齐方法,以及SVD结合词注入(Word Injection)方法,在分级变化上的平均Spearman等级相关系数为0.182,在二元变化上的平均精度(AP)为0.376。
- 所有模型在分级和二元变化上均优于频率基线,在二元变化上也优于多义性基线,表明其捕捉到了多于多义性或频率效应的信息。
- 在新黄金标准上的性能低于以往研究,可能由于语料规模较小且噪声更高,凸显了在真实、小规模数据上评估的挑战。
- 局部邻域距离(LND)度量在此设置下优于余弦距离(CD),与以往发现相反,可能由于分级与二元变化评估方式的差异。
- 本研究建立了首个大规模、合成的LSC检测黄金标准,使模型评估更加可靠且具有普适性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。