Skip to main content
QUICK REVIEW

[论文解读] Reasoning over Hybrid Chain for Table-and-Text Open Domain QA

Wanjun Zhong, Junjie Huang|arXiv (Cornell University)|Jan 15, 2022
Topic Modeling被引用 10
一句话总结

本文提出CARP,一种面向表格与文本开放域问答的链中心推理与预训练框架。该框架将中间推理建模为连接表格与文本的混合链,通过在合成推理路径上采用新颖的链中心预训练方法来增强推理能力,并在OTT-QA数据集上实现了最先进性能,同时提升了复杂推理任务的可解释性与鲁棒性。

ABSTRACT

Tabular and textual question answering requires systems to perform reasoning over heterogeneous information, considering table structure, and the connections among table and text. In this paper, we propose a ChAin-centric Reasoning and Pre-training framework (CARP). CARP utilizes hybrid chain to model the explicit intermediate reasoning process across table and text for question answering. We also propose a novel chain-centric pre-training method, to enhance the pre-trained model in identifying the cross-modality reasoning process and alleviating the data sparsity problem. This method constructs the large-scale reasoning corpus by synthesizing pseudo heterogeneous reasoning paths from Wikipedia and generating corresponding questions. We evaluate our system on OTT-QA, a large-scale table-and-text open-domain question answering benchmark, and our system achieves the state-of-the-art performance. Further analyses illustrate that the explicit hybrid chain offers substantial performance improvement and interpretablity of the intermediate reasoning process, and the chain-centric pre-training boosts the performance on the chain extraction.

研究动机与目标

  • 解决在开放域问答中对异构知识源——结构化表格与非结构化文本——进行推理的挑战。
  • 通过显式建模表格与文本之间中间推理步骤,克服黑箱推理模型的局限性。
  • 通过从维基百科合成大规模伪异构推理路径,减少推理标注中的数据稀疏性。
  • 通过专注于链提取与跨模态推理的新颖预训练方法,提升模型的泛化能力与推理能力。
  • 通过显式化并可追溯的推理过程,提升问答系统的可解释性与性能。

提出的方法

  • 构建一个异构图,其中节点代表从检索到的表格与段落中提取的信息单元,边代表结构与语义连接。
  • 使用基于Transformer的模型从图中提取最合理的混合推理链,表示通往答案的逐步推理路径。
  • 设计一种链中心预训练方法,自动从维基百科表格与段落中合成大规模推理路径。
  • 从合成的推理路径生成多跳问题,以在跨模态推理模式上预训练模型。
  • 联合微调链提取头与问答头,利用合成推理语料库以同时提升推理可追溯性与答案准确性。
  • 利用表格的清晰结构以及表格与文本之间的连接关系,引导自动构建复杂、多跳的推理路径。

实验结果

研究问题

  • RQ1显式混合推理链是否能提升表格与文本开放域问答的性能与可解释性?
  • RQ2在无人工标注推理链的情况下,链中心预训练方法在增强模型推理能力方面的有效性如何?
  • RQ3合成推理语料在复杂多跳推理问题上的泛化能力提升程度如何?
  • RQ4与端到端方法相比,混合链机制是否能减少冗余表格与段落内容带来的噪声?
  • RQ5该框架在涉及数值比较或顺序逻辑的复杂推理模式下的表现如何?

主要发现

  • 所提出的CARP框架在OTT-QA基准上实现了最先进性能,优于现有开放域表格与文本问答方法。
  • 链中心预训练方法显著提升了混合链提取模型的性能,尤其在复杂多跳推理问题上表现突出。
  • 显式混合链显著提升了模型性能,尤其在需要跨多个信息源进行推理的问题上。
  • 在预训练中使用合成推理路径有效缓解了人工标注推理链带来的数据稀疏性问题。
  • 混合链机制通过使中间推理步骤可追溯、可解释,增强了模型的可解释性。
  • 错误分析表明,主要失败模式源于检索到的噪声块以及处理复杂数值比较的困难,提示在检索置信度与数值推理方面仍有改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。