Skip to main content
QUICK REVIEW

[论文解读] End-to-End Table Question Answering via Retrieval-Augmented Generation

Feifei Pan, Mustafa Canim|arXiv (Cornell University)|Mar 30, 2022
Topic Modeling被引用 8
一句话总结

本论文提出 \texttt{\projName},一种端到端表格问答模型,通过检索增强生成(RAG)技术,联合微调密集向量检索器(DPR)与基于BART的序列到序列生成器。通过在单一训练过程中统一检索与生成,\texttt{\projName} 在端到端表格问答与表格检索基准上均达到最先进性能,减少了错误传播,提升了准确率,优于先前的两阶段模型。

ABSTRACT

Most existing end-to-end Table Question Answering (Table QA) models consist of a two-stage framework with a retriever to select relevant table candidates from a corpus and a reader to locate the correct answers from table candidates. Even though the accuracy of the reader models is significantly improved with the recent transformer-based approaches, the overall performance of such frameworks still suffers from the poor accuracy of using traditional information retrieval techniques as retrievers. To alleviate this problem, we introduce T-RAG, an end-to-end Table QA model, where a non-parametric dense vector index is fine-tuned jointly with BART, a parametric sequence-to-sequence model to generate answer tokens. Given any natural language question, T-RAG utilizes a unified pipeline to automatically search through a table corpus to directly locate the correct answer from the table cells. We apply T-RAG to recent open-domain Table QA benchmarks and demonstrate that the fine-tuned T-RAG model is able to achieve state-of-the-art performance in both the end-to-end Table QA and the table retrieval tasks.

研究动机与目标

  • 解决现有两阶段表格问答框架中的错误传播问题,其中检索器的不准确限制了阅读器的性能。
  • 通过在统一训练流程中整合密集检索与序列到序列生成,提升端到端表格问答性能。
  • 在端到端表格问答与独立表格检索任务上均实现最先进结果。
  • 探索在开放域表格问答中,非参数化密集向量索引与参数化生成模型联合微调的有效性。
  • 评估模型在具有挑战性的案例中的鲁棒性,特别是涉及数值计算的问题。

提出的方法

  • 模型采用双流架构:基于BERT的查询编码器用于密集检索,基于BART的序列到序列生成器用于答案生成。
  • 在单一端到端训练过程中,联合微调DPR检索器与RAG生成器,消除了独立的训练阶段。
  • 训练期间采用软硬负样本挖掘策略,利用BM25的top-k负样本表来提升检索泛化能力。
  • 检索组件使用密集向量嵌入在表格语料库中进行搜索,而生成器则基于检索到的表格上下文生成答案标记。
  • 模型通过联合使用交叉熵损失(用于生成)与对比损失(用于检索)进行端到端优化。
  • 评估在两个基准上进行:NQ-TABLES与E2E_WTQ,使用标准指标包括EM、F1、MRR与k阶召回率。

实验结果

研究问题

  • RQ1与两阶段流水线相比,联合端到端训练密集检索器与序列到序列生成器是否能提升表格问答性能?
  • RQ2在表格问答中集成DPR与RAG是否能减少从检索到生成的错误传播?
  • RQ3统一训练流程是否能在端到端表格问答与表格检索任务上均实现最先进结果?
  • RQ4软硬负样本挖掘在提升表格问答检索准确率方面效果如何?
  • RQ5哪些类型的问题对模型仍具挑战性,特别是涉及数值推理的问题?

主要发现

  • \\texttt{\projName} 在NQ-TABLES测试集上取得50.92的F1分数,优于先前最先进模型(T-RAG)3.22分。
  • 在E2E_WTQ上,\\texttt{\projName} 的Hit@1准确率达到50.65%,较CLTR模型提升4.1个百分点。
  • 在表格检索任务中,\\texttt{\projName} 在NQ-TABLES上达到R@1为46.07,超过DTR模型3.65分。
  • 在NQ-TABLES上,R@10提升至85.40,较DTR基线提升4.27分。
  • 使用k=3的软硬负样本而非k=1时,E2E_WTQ的Hit@1准确率绝对提升27.17个百分点。
  • 超过21%的错误归因于涉及数值计算的问题,表明这是当前模型的关键挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。