Skip to main content
QUICK REVIEW

[论文解读] Predicting the Semantic Textual Similarity with Siamese CNN and LSTM

Elvys Linhares Pontes, Stéphane Huet|arXiv (Cornell University)|Oct 24, 2018
Topic Modeling被引用 46
一句话总结

本文提出了一种使用 CNN 提供局部词上下文、使用 LSTM 提供全局句子表示的孪生网络 CNN+LSTM 模型,以预测语义文本相似度,在 SICK 数据集上取得了具有竞争力的结果。

ABSTRACT

Semantic Textual Similarity (STS) is the basis of many applications in Natural Language Processing (NLP). Our system combines convolution and recurrent neural networks to measure the semantic similarity of sentences. It uses a convolution network to take account of the local context of words and an LSTM to consider the global context of sentences. This combination of networks helps to preserve the relevant information of sentences and improves the calculation of the similarity between sentences. Our model has achieved good results and is competitive with the best state-of-the-art systems.

研究动机与目标

  • 将 STS 作为跨信息检索和问答等应用中的核心 NLP 任务来驱动研究。
  • 提出一种神经网络结构,将基于 CNN 的局部上下文与基于 LSTM 的全局句子表示结合起来。
  • 证明局部上下文相较纯粹的 Siamese LSTM 能提高 STS 预测的性能。
  • 在 SICK 数据集上评估所提出的模型,并与最先进的基线方法进行比较。

提出的方法

  • 使用预训练的词嵌入作为通用词表示。
  • 应用一个孪生 CNN 从相邻词生成每个词的局部上下文。
  • 将词嵌入与其 CNN 派生的局部上下文拼接,形成每个词的增强表示。
  • 用一个 LSTM 编码句子,该 LSTM 处理增强后词表示的序列。
  • 使用最终句子表示之间的曼哈顿距离计算句子相似性,并进行后验回归将分数映射到 1–5。

实验结果

研究问题

  • RQ1是否通过一个孪生 CNN 引入局部词上下文能在语义相似度估计中优于纯粹的 Siamese LSTM?
  • RQ2不同局部上下文窗口大小对 STS 性能有何影响?
  • RQ3所提出的模型与 SICK 数据集上现有的最先进 STS 系统相比如何?

主要发现

  • 局部上下文增强的孪生模型在相关指标和误差方面优于基线的 Siamese LSTM,基于 SICK 的评估结果。
  • 较短的局部上下文(3 个词)以及较长的上下文(7、9 个词)对性能有不同的影响,其中 5 词上下文表现较强。
  • 所提出的模型在 STS 任务上相对于若干最先进的架构(如基于树的 LSTM、卷积网络等)取得了具有竞争力的结果。
  • 表 1 显示若干基线方法优于公开的 Siamese LSTM,而局部上下文变体在若干指标上达到顶级表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。