QUICK REVIEW
[论文解读] A Comparison of WordNet and Roget's Taxonomy for Measuring Semantic Similarity
Michael Mc Hale|arXiv (Cornell University)|Jan 1, 1998
Natural Language Processing Techniques参考文献 8被引用 22
一句话总结
本文评估了罗塞特国际词典作为语义分类体系在衡量词汇相似性方面的表现,应用四种既有的度量方法来评估语义相关性。研究发现,基于罗塞特词典的传统边计数方法与人类判断的相关性高达 r=0.88,接近人类表现的上限 r=0.90。
ABSTRACT
This paper presents the results of using Roget's International Thesaurus as the taxonomy in a semantic similarity measurement task. Four similarity metrics were taken from the literature and applied to Roget's The experimental evaluation suggests that the traditional edge counting approach does surprisingly well (a correlation of r=0.88 with a benchmark set of human similarity judgements, with an upper bound of r=0.90 for human subjects performing the same task.)
研究动机与目标
- 评估罗塞特国际词典作为语义相似性测量中WordNet的替代方案的可行性。
- 评估四种现有相似性度量方法在罗塞特词典上的表现。
- 确定罗塞特词典上传统边计数方法与人类语义判断的一致性程度。
- 基于人工标注的相似性判断,建立以罗塞特为基础的语义相似性基准。
提出的方法
- 将文献中四种语义相似性度量方法应用于罗塞特国际词典作为基础分类体系。
- 利用分类体系结构计算词对之间的路径长度,作为边计数相似性的基础。
- 基于罗塞特分层结构中概念之间的最短路径计算相似性得分。
- 使用标准的人工相似性判断基准集进行评估与相关性分析。
- 计算皮尔逊相关系数,将系统的相似性得分与人类判断进行比较。
实验结果
研究问题
- RQ1罗塞特词典在衡量语义相似性方面与WordNet相比如何?
- RQ2在罗塞特词典上应用边计数方法的性能如何?
- RQ3罗塞特词典上的边计数方法在多大程度上接近人类在相同任务上的表现?
- RQ4罗塞特词典能否作为语义相似性任务中WordNet的可行替代方案?
主要发现
- 罗塞特词典上的边计数方法与人类相似性判断的相关性达到 r=0.88。
- 该表现极为接近人类受试者在相同任务中观察到的上限 r=0.90。
- 结果表明,罗塞特词典是语义相似性测量的有力候选方案,其表现可与成熟的基于WordNet的方法相媲美。
- 传统边计数方法在罗塞特词典上的表现出人意料地出色,其简单性远超预期。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。