Skip to main content
QUICK REVIEW

[论文解读] Discern: Discourse-Aware Entailment Reasoning Network for Conversational Machine Reading

Yifan Gao, Chien-Sheng Wu|arXiv (Cornell University)|Oct 5, 2020
Topic Modeling参考文献 24被引用 6
一句话总结

Discern 提出了一种用于对话式机器阅读的论述感知蕴涵推理网络,该网络将规则文本分割为基本论述单元(EDU),并针对每个 EDU 预测其相对于用户输入的蕴涵状态(蕴涵/矛盾/中性)。通过显式建模蕴涵状态与最终决策之间的依赖关系,该方法在 ShARC 基准测试中实现了最先进性能,决策准确率达到 78.3% 的宏平均准确率,后续问题生成的 BLEU1 得分为 64.0。

ABSTRACT

Document interpretation and dialog understanding are the two major challenges for conversational machine reading. In this work, we propose Discern, a discourse-aware entailment reasoning network to strengthen the connection and enhance the understanding for both document and dialog. Specifically, we split the document into clause-like elementary discourse units (EDU) using a pre-trained discourse segmentation model, and we train our model in a weakly-supervised manner to predict whether each EDU is entailed by the user feedback in a conversation. Based on the learned EDU and entailment representations, we either reply to the user our final decision "yes/no/irrelevant" of the initial question, or generate a follow-up question to inquiry more information. Our experiments on the ShARC benchmark (blind, held-out test set) show that Discern achieves state-of-the-art results of 78.3% macro-averaged accuracy on decision making and 64.0 BLEU1 on follow-up question generation. Code and models are released at https://github.com/Yifan-Gao/Discern.

研究动机与目标

  • 解决在对话式机器阅读中理解具有复杂逻辑结构(如合取、析取)的规则文本的挑战。
  • 通过建模用户输入与规则条件之间的条件级蕴涵状态,提升对话理解能力。
  • 通过显式关联蕴涵预测与最终决策,提升决策制定与后续问题生成能力。
  • 克服先前方法将蕴涵推理视为多任务目标或忽略条件级逻辑结构的局限性。
  • 提供一种弱监督框架,利用论述分割技术解析规则文本中的内联条件,以实现更优的推理效果。

提出的方法

  • 使用预训练的论述分割模型将规则文本分割为类子句的基本论述单元(EDU),以隔离各个独立条件。
  • 采用堆叠的句间 Transformer 架构,对每个 EDU 的用户情景与对话历史进行编码,以预测蕴涵置信度分数(蕴涵/矛盾/中性)。
  • 将预测的蕴涵状态映射为每个条件的蕴涵向量,并利用规则的逻辑结构(如 AND、OR)对这些向量进行组合,以推导最终决策。
  • 采用弱监督方式训练模型,使用最终决策的黄金标准标签(是/否/询问/无关)来监督蕴涵预测头。
  • 通过识别蕴涵状态为中性或矛盾的未明确条件,利用相同的蕴涵感知表示生成后续问题。
  • 采用联合训练目标,使蕴涵推理与决策制定及问题生成对齐,避免多任务学习的缺陷。

实验结果

研究问题

  • RQ1将规则文本通过论述感知方式分割为 EDU 是否能提升对话式机器阅读中的条件级蕴涵推理?
  • RQ2显式建模蕴涵状态与最终决策之间的依赖关系,是否能带来优于多任务或端到端方法的性能表现?
  • RQ3与先前方法相比,该模型在处理合取和析取等复杂逻辑结构时表现如何?
  • RQ4用户情景理解的主要失败模式是什么?它们如何影响蕴涵预测与决策准确率?
  • RQ5论述感知的蕴涵推理在多大程度上能提升对话式问答系统中的后续问题生成能力?

主要发现

  • Discern 在 ShARC 基准测试的盲测保留测试集上,实现了决策任务 78.3% 的新最先进宏平均准确率。
  • 与之前最佳模型 EMT 相比,该模型在微观平均准确率上提升了 3.8 个百分点,在宏平均准确率上提升了 3.5 个百分点。
  • Discern 在内联条件和合取结构上表现尤为出色,证明了 EDU 级蕴涵推理的有效性。
  • 该模型生成的后续问题 BLEU1 得分为 64.0,与之前最佳模型 EMT 表现相当。
  • 分析显示,用户情景理解是主要瓶颈,尤其在常识推理与同义改写推理方面,模型常出现蕴涵状态误分类。
  • 尽管在结构化条件上表现良好,该模型在处理析取结构时仍存在困难,表明需要更优的规则文本中逻辑析取处理机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。