[论文解读] Topic-Aware Neural Keyphrase Generation for Social Media Language
该论文提出了一种主题感知的神经关键词生成模型,联合学习潜在主题并为社交媒体文本生成关键词,显著优于现有的抽取方法与生成方法。通过将主题建模整合到序列到序列框架中,该模型缓解了非正式社交媒体语言中的数据稀疏性问题,并实现了最先进性能,包括在微博数据集上达到34.99%的F1@1——较之前工作高出2.98个百分点。
A huge volume of user-generated content is daily produced on social media. To facilitate automatic language understanding, we study keyphrase prediction, distilling salient information from massive posts. While most existing methods extract words from source posts to form keyphrases, we propose a sequence-to-sequence (seq2seq) based neural keyphrase generation framework, enabling absent keyphrases to be created. Moreover, our model, being topic-aware, allows joint modeling of corpus-level latent topic representations, which helps alleviate the data sparsity that widely exhibited in social media language. Experiments on three datasets collected from English and Chinese social media platforms show that our model significantly outperforms both extraction and generation models that do not exploit latent topics. Further discussions show that our model learns meaningful topics, which interprets its superiority in social media keyphrase generation.
研究动机与目标
- 为解决在嘈杂、非正式的社交媒体文本中进行关键词预测的挑战,其中关键词常包含源文本中未出现的词汇。
- 通过将语料级潜在主题与关键词生成联合建模,克服社交媒体语言中的数据稀疏性问题。
- 开发一种端到端可训练的框架,将神经主题建模与序列到序列生成相结合,以提升关键词预测性能。
- 探究潜在主题是否能增强关键词生成,特别是针对社交媒体中常见的缺失词关键词。
提出的方法
- 提出一种用于关键词生成的序列到序列(seq2seq)神经网络,允许生成源文本中未明确出现的关键词。
- 引入主题感知注意力机制与主题感知隐藏状态,使潜在主题同时指导注意力机制与解码器隐藏状态。
- 采用神经主题模型(NTM)以端到端方式联合训练主题表征与生成模型。
- 使用复制机制保留未登录词,结合生成与复制机制以增强鲁棒性。
- 采用联合优化目标,将关键词生成损失与主题建模损失相结合。
- 利用跨帖子的词共现模式推断潜在主题,以指示相关关键词。
实验结果
研究问题
- RQ1联合建模潜在主题是否能提升在数据稀疏性较高的社交媒体文本上的关键词生成性能?
- RQ2引入主题感知注意力与隐藏状态是否能带来比标准seq2seq模型更好的泛化能力?
- RQ3潜在主题在识别源文本中未出现的关键词方面有多有效?
- RQ4模型是否学习到可解释且语义有意义的主题,与实际关键词语义相一致?
- RQ5主题感知生成模型在社交媒体数据集上的性能与基于抽取的方法及非主题感知生成模型相比如何?
主要发现
- 该模型在Twitter数据集上达到38.49%的F1@1,较最强基线模型(Seq2Seq-Copy)高出1.89个百分点。
- 在Weibo数据集上,该模型达到34.99%的F1@1,较最先进生成模型(32.01%)高出2.98个百分点。
- 消融实验证实,主题感知注意力与主题感知隐藏状态均对性能有显著贡献,完整模型表现最佳。
- 该模型学习到了有意义的潜在主题,例如“super bowl”,其包含“yellow”、“pants”、“steeler”、“packer”等相关词汇,表明强大的语义对齐能力。
- 案例研究显示,该模型通过关注“yellow”和“pants”等主题相关词汇,正确预测出“super bowl”,而基线模型则错误生成“team follow back”。
- 由于非正式文本中缺失词关键词比例更高且词序更随意,主题建模在社交媒体中的收益大于在正式科技文献中的收益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。