Skip to main content
QUICK REVIEW

[论文解读] Long-Term Memory Networks for Question Answering

Fenglong Ma, Radha Chitta|arXiv (Cornell University)|Jul 6, 2017
Topic Modeling被引用 6
一句话总结

本文提出长时记忆网络(LTMN),一种弱监督、端到端可训练的循环神经网络,通过将外部记忆模块与长短期记忆(LSTM)网络结合,在问答任务中生成多词答案。该模型在合成 bAbI 和真实世界斯坦福问答数据集上均达到最先进性能,在多词答案生成方面优于现有弱监督模型,且仅需极少监督。

ABSTRACT

Question answering is an important and difficult task in the natural language processing domain, because many basic natural language processing tasks can be cast into a question answering task. Several deep neural network architectures have been developed recently, which employ memory and inference components to memorize and reason over text information, and generate answers to questions. However, a major drawback of many such models is that they are capable of only generating single-word answers. In addition, they require large amount of training data to generate accurate answers. In this paper, we introduce the Long-Term Memory Network (LTMN), which incorporates both an external memory module and a Long Short-Term Memory (LSTM) module to comprehend the input data and generate multi-word answers. The LTMN model can be trained end-to-end using back-propagation and requires minimal supervision. We test our model on two synthetic data sets (based on Facebook's bAbI data set) and the real-world Stanford question answering data set, and show that it can achieve state-of-the-art performance.

研究动机与目标

  • 解决现有神经网络在问答任务中生成多词答案的局限性。
  • 开发一种弱监督模型,仅需极少标注数据,避免对强监督事实注释的依赖。
  • 将外部记忆模块与 LSTM 集成,实现在序列输入文本上的长期记忆与推理。
  • 通过反向传播实现模型的端到端训练,提升泛化能力并减少对监督的依赖。
  • 在合成(bAbI)和真实世界(SQuAD)问答基准上评估性能。

提出的方法

  • LTMN 模型使用分布式表示将输入句子和问题编码为密集向量嵌入。
  • 它采用外部记忆模块,随时间存储并检索输入序列中的相关事实。
  • 该模型使用注意力机制计算输入句子与问题之间的匹配概率,识别支持性事实。
  • 长短期记忆(LSTM)网络通过处理所关注的事实和问题上下文,生成多词答案。
  • 整个架构通过反向传播实现端到端训练,仅需极少监督,每个问题均以前序所有句子作为输入。
  • 通过精确匹配准确率(EMA)和 BLEU 分数对多词答案生成进行评估。

实验结果

研究问题

  • RQ1弱监督神经网络架构能否在问答任务中生成准确的多词答案?
  • RQ2将外部记忆模块与 LSTM 集成后,如何提升在长输入序列上的推理与记忆能力?
  • RQ3LTMN 模型在所需监督更少的情况下,性能是否可与 MemNN 和 DMN 等强监督模型相媲美?
  • RQ4LTMN 在 bAbI 数据集中对共指、否定和路径查找等多样化推理任务的性能如何?
  • RQ5LTMN 是否能泛化到真实世界问答基准,如斯坦福问答数据集?

主要发现

  • 在单字答案 bAbI 数据集上,LTMN 的平均准确率为 73.9%,优于弱监督 LSTM+Attention(73.9%)和 MemN2N(93.4%),并接近强监督 MemNN(93.6%)和 DMN(93.6%)的性能。
  • 在多字答案 bAbI 数据集上,LTMN 的平均 EMA 为 72.6%,BLEU 为 75.9%,PMA 为 78.8%,显著优于 LSTM(42.2% EMA)和 LSTM+Attention(46.8% EMA)。
  • LTMN 在 bAbI 的 20 项任务中有 10 项达到 100% 准确率,包括‘基础推理’和‘行为动机’等复杂推理任务,表现出强大的泛化能力。
  • 在‘路径查找’任务中,LTMN 的 PMA 达到 100%,优于 LSTM+Attention(59.1%)和 LSTM(35.1%),表明其在长序列上的推理能力更强。
  • 在真实世界斯坦福问答数据集上,LTMN 达到最先进性能,证实其在合成基准之外的有效性。
  • 由于支持事实计算效率低下,该模型在极长输入序列和大词汇量下表现较差,表明其可扩展性存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。