[论文解读] Open-Retrieval Conversational Machine Reading
本文提出了一种开放检索对话机器阅读设置,其中系统必须从多个嘈杂的规则文本中检索并推理以交互式回答用户问题。所提出的Mudern模型采用话语感知的多段落蕴含推理方法,以提取条件、评估满足状态,并决定是否回答或提出澄清问题,在新创建的OR-ShARC数据集上实现了最先进性能。
In conversational machine reading, systems need to interpret natural language rules, answer high-level questions such as "May I qualify for VA health care benefits?", and ask follow-up clarification questions whose answer is necessary to answer the original question. However, existing works assume the rule text is provided for each user question, which neglects the essential retrieval step in real scenarios. In this work, we propose and investigate an open-retrieval setting of conversational machine reading. In the open-retrieval setting, the relevant rule texts are unknown so that a system needs to retrieve question-relevant evidence from a collection of rule texts, and answer users' high-level questions according to multiple retrieved rule texts in a conversational manner. We propose MUDERN, a Multi-passage Discourse-aware Entailment Reasoning Network which extracts conditions in the rule texts through discourse segmentation, conducts multi-passage entailment reasoning to answer user questions directly, or asks clarification follow-up questions to inquiry more information. On our created OR-ShARC dataset, MUDERN achieves the state-of-the-art performance, outperforming existing single-passage conversational machine reading models as well as a new multi-passage conversational machine reading baseline by a large margin. In addition, we conduct in-depth analyses to provide new insights into this new setting and our model.
研究动机与目标
- 为解决对话式机器阅读中的空白,提出一种开放检索设置,其中相关规则文本并非预先提供。
- 创建首个开放检索对话式机器阅读数据集OR-ShARC,通过将不完整用户问题与特定福利关联以消除歧义。
- 设计并评估Mudern,一种多段落话语感知蕴含推理网络,可在多份检索到的规则文本上推理以做出决策或提出后续问题。
- 分析模型在已见与未见规则文本上的鲁棒性,揭示其在零样本泛化到新规则文档方面的挑战。
提出的方法
- 将ShARC数据集中不完整的问题重新表述为完整且与特定福利相关的问题,以消除开放检索设置中的歧义。
- 使用TF-IDF从文档集合中检索多份相关规则文本,包括嘈杂或无关的文本。
- 应用话语分割以识别并提取规则文本中的单个条件,提升结构化理解能力。
- 采用多段落蕴含推理框架,利用用户提供的信息评估每个条件的满足状态。
- 结合RoBERTa-based句子编码与跨句Transformer层,以建模句间关系并提升推理能力。
- 使用蕴含监督进行训练,使模型根据条件满足状态将决策分类为'是'、'否'或'询问'。
实验结果
研究问题
- RQ1当相关规则文本未预先提供、必须从大型文档集合中检索时,对话式机器阅读模型的性能会如何下降?
- RQ2话语分割对多段落推理中条件提取与决策准确率有何影响?
- RQ3多段落蕴含推理在对话决策过程中处理嘈杂或无关检索到的规则文本方面有多有效?
- RQ4模型能否泛化到训练期间未出现的新规则文档?
- RQ5模型架构中的哪些组件——话语分割、Transformer层或蕴含推理——对性能最为关键?
主要发现
- Mudern在OR-ShARC数据集上达到最先进性能,测试集宏F1为75.3%,优于单段落模型和MP-RoBERTa基线模型。
- 当移除蕴含推理时,模型的宏准确率下降3.9%,证实其在决策中的关键作用。
- 话语分割使宏准确率提升0.7%,表明其在解析含多个从句的复杂规则句子方面具有价值。
- 模型在已见规则文本上的表现显著优于未见规则文本(宏准确率分别为88.1%与66.4%),凸显泛化挑战。
- 消融实验表明,句间Transformer层对测试集宏准确率贡献1.1%,显示其与词级别注意力的互补性。
- 在'询问'类别中,Mudern达到最高预测准确率,证明其在识别何时需要澄清问题方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。