[论文解读] Broad Context Language Modeling as Reading Comprehension
本文提出将 LAMBADA 语言建模任务视为阅读理解问题,通过在包含 180 万个实例的自动构建数据集上训练神经阅读模型,其中正确词汇出现在上下文中。通过利用在该数据上训练的基于注意力机制的神经网络,该方法将 LAMBADA 上零样本语言建模的准确率从 7.3% 提升至 49.0%,表明上下文感知的神经阅读模型在长上下文词汇预测任务上显著优于传统语言模型。
Progress in text understanding has been driven by large datasets that test particular capabilities, like recent datasets for reading comprehension (Hermann et al., 2015). We focus here on the LAMBADA dataset (Paperno et al., 2016), a word prediction task requiring broader context than the immediate sentence. We view LAMBADA as a reading comprehension problem and apply comprehension models based on neural networks. Though these models are constrained to choose a word from the context, they improve the state of the art on LAMBADA from 7.3% to 49%. We analyze 100 instances, finding that neural network readers perform well in cases that involve selecting a name from the context based on dialogue or discourse cues but struggle when coreference resolution or external knowledge is needed.
研究动机与目标
- 提升 LAMBADA 基准测试的最先进性能,该任务是需要长上下文的具有挑战性的词汇预测任务。
- 探究是否可通过将词汇预测视为阅读理解问题,将神经阅读理解模型适配于语言建模任务。
- 分析当前模型面临挑战的语言现象类型,特别是代词指代消解和外部知识。
- 构建一个大规模、自动生成的训练数据集,用于基于 LAMBADA 类似结构的上下文感知语言建模。
- 评估神经阅读模型与人类在 LAMBADA 的测试集和对照集上的泛化差距。
提出的方法
- 作者通过从 BookCorpus 中自动选取目标词汇出现在上下文中的段落,构建了包含 180 万个实例的训练集,从而实现监督学习。
- 训练了三种神经阅读模型——Stanford 阅读器、Attention Sum 阅读器和 Gated-Attention 阅读器——基于上下文预测段落的最后一个词。
- 每个模型使用双向 RNN 编码上下文和问题(含空缺),利用问题表示计算上下文位置的注意力权重,并通过上下文向量的加权和选择答案。
- 模型通过端到端训练,词嵌入从随机初始化学习,未使用预训练嵌入。
- 注意力机制因模型而异:Attention Sum 使用内积,Stanford 使用双线性,Gated-Attention 阅读器使用更复杂的门控注意力机制。
- 评估在原始 LAMBADA 测试集上进行,性能以预测最后一个词的 top-1 准确率衡量。
实验结果
研究问题
- RQ1在自动构建的数据上训练的神经阅读理解模型是否能显著提升 LAMBADA 语言建模基准的性能?
- RQ2在 LAMBADA 上,哪些语言现象(如代词指代、话语推理或外部知识)对当前神经阅读模型最具挑战性?
- RQ3神经阅读模型的性能与强基线语言模型相比如何,特别是在正确词汇未出现在上下文中的样本上?
- RQ4答案是否出现在上下文中在多大程度上与模型成功相关?这如何影响泛化能力?
- RQ5LAMBADA 测试集的人类表现估计值是多少?与模型性能相比如何?
主要发现
- 所提方法将 LAMBADA 基准测试的最先进性能从 7.3% 提升至 49.0%,准确率提升 41.7 个百分点。
- 神经阅读模型在需要简单名称选择或说话者追踪的任务上表现最佳,分别在 9 个和 19 个实例上达到 100% 和 84% 的准确率。
- 模型在需要代词指代消解或外部知识的任务上表现显著不佳,这些类别上的准确率大幅下降。
- 作者估计人类在测试集上的表现为 36%,表明最佳模型与人类表现之间存在 14 个百分点的差距。
- 尽管准确率达到 49%,但模型在 17% 的实例上失败,这些实例中正确词汇未出现在上下文中,凸显了该方法的关键局限性。
- 研究发现,对照集(答案未出现在上下文中)比测试集更具挑战性,且两组的性能排名相似,表明训练数据具有代表性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。