[论文解读] KPEval: Towards Fine-Grained Semantic-Based Keyphrase Evaluation
KPEval 提出了一种细粒度的、基于语义的关键词提取系统评估框架,超越了精确匹配,从四个维度进行评估:参考一致性、忠实度、多样性和实用性。该框架利用语义嵌入和基于检索的指标,展现出与人类偏好更高的对齐性,并揭示出像 GPT-3.5 这类大语言模型优于以往的 SOTA 模型,但没有单一模型在所有评估方面均表现最佳。
Despite the significant advancements in keyphrase extraction and keyphrase generation methods, the predominant approach for evaluation mainly relies on exact matching with human references. This scheme fails to recognize systems that generate keyphrases semantically equivalent to the references or diverse keyphrases that carry practical utility. To better assess the capability of keyphrase systems, we propose KPEval, a comprehensive evaluation framework consisting of four critical aspects: reference agreement, faithfulness, diversity, and utility. For each aspect, we design semantic-based metrics to reflect the evaluation objectives. Meta-evaluation studies demonstrate that our evaluation strategy correlates better with human preferences compared to a range of previously proposed metrics. Using KPEval, we re-evaluate 23 keyphrase systems and discover that (1) established model comparison results have blind-spots especially when considering reference-free evaluation; (2) large language models are underestimated by prior evaluation works; and (3) there is no single best model that can excel in all the aspects.
研究动机与目标
- 解决现有精确匹配评估在关键词系统中的局限性,即无法识别语义等价性或实际效用。
- 克服对参考文本评估的过度依赖,避免忽略忠实度、多样性及实际应用效用等关键属性。
- 开发一种整体性评估框架,使模型性能与具体应用场景需求保持一致。
- 证明现有评估指标与人类偏好相关性较差,而基于语义的指标可显著提升这种相关性。
- 重新评估 21 个关键词系统,以发现先前模型比较中的盲点,并揭示大语言模型被低估的优势。
提出的方法
- 设计一种基于高质量、大规模关键词专用嵌入模型的短语级语义匹配指标,该模型在 KP20k 和 KPTimes 数据集上进行训练。
- 提出一种基于语义 F1(SemF1)的参考一致性指标,利用密集语义嵌入计算预测关键词与参考关键词之间的相似度。
- 提出一种忠实度指标,通过序列到序列的一致性模型评估预测关键词是否基于输入文档内容。
- 设计一种基于嵌入相似度(emb_sim)的多样性指标,用于衡量预测关键词之间的概念差异性。
- 通过密集检索实现实用性评估,模拟下游信息检索性能,测量检索文档的平均倒数排名(RR)。
- 在五个人工标注偏好数据的关键词系统上进行元评估,以验证 KPEval 指标与人类判断的相关性。

实验结果
研究问题
- RQ1与所提出的基于语义的指标相比,现有基于参考的评估指标与人类偏好的相关性如何?
- RQ2当前评估实践在多大程度上未能识别出生成语义正确或多样关键词的模型?
- RQ3当使用 KPEval 评估时,大语言模型(如 GPT-3.5)在多个评估维度上的表现如何?
- RQ4是否存在一个模型在所有四个评估方面(参考一致性、忠实度、多样性、实用性)均表现最佳?
- RQ5像 KPEval 这类整体性评估框架是否能揭示既定模型比较中的盲点,并发现此前被忽视的模型能力?
主要发现
- 所提出的基于语义的参考一致性指标(SemF1)与人类偏好的 Kendall’s Tau 达到 0.657,优于现有指标超过 0.15 的绝对点数。
- 许多对精确匹配的启发式改进(如 n-gram 或编辑距离松弛)出人意料地未能提升与人类判断的相关性,凸显了这些方法的局限性。
- ExHiRD-h 在标准基准中曾被忽视,但在多个方面表现强劲,揭示了先前模型比较中的盲点。
- 大语言模型(如 GPT-3.5)显著优于现有的 SOTA 关键词生成与抽取模型,尤其在忠实度和实用性方面,挑战了以往的结论。
- 没有单一模型在所有四个评估维度上均表现最佳——不同模型在不同方面表现出优势,表明需要根据应用场景进行特定评估。
- 通过密集检索实现的实用性评估显示,与文档语义对齐度更高的模型(如 ExHiRD-h)可实现平均倒数排名(RR)为 1.0,表明对相关查询实现了完美检索性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。