[论文解读] Tracking State Changes in Procedural Text: A Challenge Dataset and Models for Process Paragraph Comprehension
本文提出了 ProPara,这是首个大规模的自然语言程序性文本数据集,对动态过程中实体状态(存在性和位置)进行了细粒度标注。本文提出了两种新型神经模型——ProLocal 和 ProGlobal,通过使用 LSTM 输入编码和跨度预测,将状态跟踪准确率提高了最高达 19%,在真实世界、隐含因果推理的流程理解任务中优于先前方法。
We present a new dataset and models for comprehending paragraphs about processes (e.g., photosynthesis), an important genre of text describing a dynamic world. The new dataset, ProPara, is the first to contain natural (rather than machine-generated) text about a changing world along with a full annotation of entity states (location and existence) during those changes (81k datapoints). The end-task, tracking the location and existence of entities through the text, is challenging because the causal effects of actions are often implicit and need to be inferred. We find that previous models that have worked well on synthetic data achieve only mediocre performance on ProPara, and introduce two new neural models that exploit alternative mechanisms for state prediction, in particular using LSTM input encoding and span prediction. The new models improve accuracy by up to 19%. The dataset and models are available to the community at http://data.allenai.org/propara.
研究动机与目标
- 为解决在真实世界程序性文本中推理隐含状态变化的挑战,其中因果影响未被明确说明。
- 创建一个大规模的自然语言数据集,对流程步骤中实体的存在性和位置进行详细标注。
- 开发能够推断并传播复杂、隐含因果链中状态变化的模型。
- 证明在合成数据上训练的现有模型在真实世界程序性文本上表现不佳,凸显了新方法的必要性。
- 提供一个基准和开源资源,以推动动态世界推理和阅读理解研究的发展。
提出的方法
- ProPara 数据集由 488 篇人工撰写的程序性段落构建而成,共包含 81,000 个数据点的实体状态标注。
- 每个段落被分割为若干步骤,每个实体在每一步的状态均通过众包标注(每个样本 5 名 Turkers)进行标注。
- 提出了两种新型神经模型:ProLocal 利用局部上下文和跨度预测来推断状态变化,而 ProGlobal 则利用全局一致性约束和基于 LSTM 的编码。
- ProLocal 通过注意力机制在句子跨度上进行局部推理,以预测实体的位置和存在性,不进行反向传播。
- ProGlobal 使用全局推理机制,通过 LSTM 编码建模长距离依赖关系,以在所有步骤间强制保持一致性。
- 模型在 ProPara 数据集上端到端训练,使用交叉熵损失进行存在性和位置预测。
实验结果
研究问题
- RQ1在合成数据上训练的现有神经模型能否泛化到包含隐含因果推理的真实世界程序性文本?
- RQ2使用跨度预测和 LSTM 编码的模型在动态过程中追踪实体状态的效率如何?
- RQ3当前模型在自然语言中推理隐含状态变化时的主要失败模式是什么?
- RQ4全局一致性约束在程序性文本理解中的状态追踪中能提升多少?
- RQ5状态信息的反向传播在实体追踪任务中能否提升模型性能?
主要发现
- ProPara 数据集包含 488 篇人工撰写的程序性段落,共 81,000 个标注的实体状态转换,标志着与合成数据的显著转变。
- 如递归实体网络(Recurrent Entity Networks)和查询缩减网络(Query-Reduction Networks)等现有模型在 ProPara 上的表现仅略好于多数基线,表明存在显著的泛化差距。
- 所提出的 ProLocal 和 ProGlobal 模型在 ProPara 基准上将状态追踪准确率最高提升了 19%。
- 人类在该任务上的上限性能约为 80%,表明该数据集既定义明确又具有挑战性。
- 主要错误类型包括隐含创建/销毁(占错误的 37%)、位置跨度误预测(27%)、复杂句法(13%)和传播错误(9%)。
- 反向状态传播是一个关键挑战,因为当前模型如 ProGlobal、EntNet 和 QRNs 本身不具备从未来状态推断过去状态的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。