[论文解读] One Size Does Not Fit All: Generating and Evaluating Variable Number of Keyphrases
本文提出一种用于关键词生成的序列到序列模型,通过目标编码器和正交正则化实现关键词数量的动态控制并提升生成多样性。引入了针对可变长度输出的新评估指标——F₁@𝒪 和 F₁@ℳ,并提出了来自 Stack Overflow 的新数据集 StackEx,在 KP20k 和 SemEval 等多个基准上表现出优于基线模型的性能。
Different texts shall by nature correspond to different number of keyphrases. This desideratum is largely missing from existing neural keyphrase generation models. In this study, we address this problem from both modeling and evaluation perspectives. We first propose a recurrent generative model that generates multiple keyphrases as delimiter-separated sequences. Generation diversity is further enhanced with two novel techniques by manipulating decoder hidden states. In contrast to previous approaches, our model is capable of generating diverse keyphrases and controlling number of outputs. We further propose two evaluation metrics tailored towards the variable-number generation. We also introduce a new dataset StackEx that expands beyond the only existing genre (i.e., academic writing) in keyphrase generation tasks. With both previous and new evaluation metrics, our model outperforms strong baselines on all datasets.
研究动机与目标
- 解决现有神经关键词生成模型中缺乏动态关键词数量控制的问题。
- 通过目标编码器和正交正则化调控解码器隐藏状态,提升生成结果的多样性。
- 提出新的评估指标(F₁@𝒪 和 F₁@ℳ),用于考虑可变数量关键词输出,而非固定 k。
- 引入 StackEx,一个来自 Stack Overflow 社区的新关键词生成数据集,扩展至非学术文本领域。
- 证明固定 k 的束搜索在归一化问题下表现次优,且在可变长度设置下贪婪解码可优于束搜索。
提出的方法
- 使用循环神经网络的序列到序列模型,将多个关键词以分隔符分隔的形式生成序列。
- 引入目标编码器以建模短语级表征,改善解码器隐藏状态的多样性。
- 对解码器隐藏状态转移应用正交正则化,以鼓励多样性并防止模式崩溃。
- 采用自终止解码策略,实现在不预设 k 值情况下的动态输出长度。
- 设计两种新评估指标:F₁@𝒪(基于最优解的)和 F₁@ℳ(基于模型的),均适配可变大小的输出。
- 在现有数据集(KP20k、Inspec 等)和新数据集 StackEx 上进行训练与评估,对比束搜索与贪婪解码的结果。
实验结果
研究问题
- RQ1神经模型是否能在不依赖固定 k 的束搜索条件下,实现关键词数量的可变生成?
- RQ2目标编码和正交正则化如何影响生成关键词的多样性和质量?
- RQ3以固定 k(如 5 或 10)进行评估的标准做法是否会导致性能比较产生偏差或误导?
- RQ4考虑可变输出大小的新评估指标能否提升关键词生成中模型比较的可靠性?
- RQ5与传统学术数据集相比,非学术性、社区驱动的数据集 StackEx 在关键词分布和模型泛化能力方面表现如何?
主要发现
- 所提出的 CatSeqD 模型在所有数据集(包括 KP20k、Inspec、Krapivin、NUS 和 SemEval)上均优于强基线模型,其在 KP20k 上的 F₁@𝒪 分数最高达 35.7。
- 消融实验表明,通过目标编码器实现的语义覆盖显著提升性能;而正交正则化单独使用时会损害性能,但与语义覆盖联合使用时,可在 KP20k 上将结果提升高达 4.0 分。
- 在可变数量生成任务中,贪婪解码优于束搜索,表明束搜索在动态输出长度下易生成短且冗余的序列。
- 该模型平均生成 89.70 个唯一短语(束大小为 50),而 CatSeq 仅生成 20.38 个,证实目标编码与正交正则化显著增强了多样性。
- 解码器隐藏状态的 t-SNE 可视化显示,CatSeqD 生成了分离良好的聚类,表明其解码状态更具区分性和多样性;而 CatSeq 则形成密集且模糊的聚类。
- 新数据集 StackEx 的样本平均关键词数为 2.7(方差 1.4),与学术数据集(平均 5.3–15.7)形成鲜明对比,表明其具有更高的文体多样性与现实世界适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。