Skip to main content
QUICK REVIEW

[论文解读] Query and Output: Generating Words by Querying Distributed Word Representations for Paraphrase Generation

Shuming Ma, Xu Sun|arXiv (Cornell University)|Mar 5, 2018
Natural Language Processing Techniques被引用 16
一句话总结

本文提出词嵌入注意力网络(WEAN),一种新颖的序列到序列模型,通过注意力机制查询分布式词嵌入来生成词语,相较于标准序列到序列模型,提升了语义准确性。WEAN在文本简化和抽象摘要基准测试中达到最先进性能,在英文数据集上分别超越基线6.3和5.5 BLEU分数,在中文数据集上达到5.7 ROUGE-2 F1分数。

ABSTRACT

Most recent approaches use the sequence-to-sequence model for paraphrase generation. The existing sequence-to-sequence model tends to memorize the words and the patterns in the training dataset instead of learning the meaning of the words. Therefore, the generated sentences are often grammatically correct but semantically improper. In this work, we introduce a novel model based on the encoder-decoder framework, called Word Embedding Attention Network (WEAN). Our proposed model generates the words by querying distributed word representations (i.e. neural word embeddings), hoping to capturing the meaning of the according words. Following previous work, we evaluate our model on two paraphrase-oriented tasks, namely text simplification and short text abstractive summarization. Experimental results show that our model outperforms the sequence-to-sequence baseline by the BLEU score of 6.3 and 5.5 on two English text simplification datasets, and the ROUGE-2 F1 score of 5.7 on a Chinese summarization dataset. Moreover, our model achieves state-of-the-art performances on these three benchmark datasets.

研究动机与目标

  • 解决标准序列到序列模型在记忆训练模式而非学习词语语义方面的局限性。
  • 减少词生成器中的参数数量,以提升训练效率和收敛速度。
  • 通过将词语生成建立在分布式词表示基础上,提升 paraphrase 生成中的语义保真度。
  • 在文本简化和抽象摘要基准测试中实现最先进性能。
  • 通过基于检索的匹配方式,验证注意力机制在词生成中的有效性。

提出的方法

  • 用基于注意力的机制替代标准的线性-Softmax词生成器,将RNN隐藏状态视为查询。
  • 将词嵌入用作键和值,其中注意力机制根据查询检索最相关的词嵌入。
  • 通过选择与词嵌入注意力得分最高的候选词来生成输出词语。
  • 从三个来源更新词嵌入:编码器输入、解码器输入以及输出层的查询向量。
  • 将基于注意力的词生成器整合到编码器-解码器框架中,实现端到端训练。
  • 利用预训练词嵌入的语义结构来引导生成过程,促进有意义的词语选择,而非记忆。

实验结果

研究问题

  • RQ1用基于注意力的检索机制替代标准Softmax词生成器,能否提升paraphrase生成中的语义准确性?
  • RQ2通过查询分布式词嵌入,是否能实现更好的泛化能力并减少对训练模式的记忆?
  • RQ3所提出方法在保持或提升性能的同时,能在多大程度上减少词生成器的参数数量?
  • RQ4基于注意力的词生成机制能否在文本简化和抽象摘要任务中达到最先进结果?
  • RQ5该模型在生成流畅且简化的paraphrase时,其语义意义保持能力如何?

主要发现

  • 在英文维基百科文本简化(EW-SEW)数据集上,WEAN相较于标准序列到序列基线模型,BLEU分数提升6.3分。
  • 在另一英文文本简化数据集上,WEAN相较基线模型提升5.5 BLEU分数。
  • 在中文抽象摘要数据集上,WEAN相较基线模型ROUGE-2 F1分数提升5.7分。
  • 该模型在所有三个评估基准数据集上均达到最先进性能:两个英文文本简化数据集和一个中文摘要数据集。
  • 案例研究显示,WEAN生成的paraphrase流畅、语义准确且语义保持良好,而基线模型常产生不完整、不连贯或语义偏离的输出。
  • 基于注意力的词生成器相比标准线性-Softmax层,显著减少了参数数量,从而实现更快收敛和更低内存消耗。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。