[论文解读] PACIFIC: Towards Proactive Conversational Question Answering over Tabular and Textual Data in Finance
本文提出了 PACIFIC,一个全新的数据集与任务——主动式对话问答(Proactive Conversational Question Answering, PCQA),用于混合表格与文本数据的金融领域问答。该研究提出 UniPCQA,一种统一的序列到序列框架,将数值推理转化为代码生成,并采用多任务学习与共识投票策略,提升澄清问题生成、歧义检测与答案生成的性能,展示了在金融领域中主动式、推理密集型对话问答的挑战。
To facilitate conversational question answering (CQA) over hybrid contexts in finance, we present a new dataset, named PACIFIC. Compared with existing CQA datasets, PACIFIC exhibits three key features: (i) proactivity, (ii) numerical reasoning, and (iii) hybrid context of tables and text. A new task is defined accordingly to study Proactive Conversational Question Answering (PCQA), which combines clarification question generation and CQA. In addition, we propose a novel method, namely UniPCQA, to adapt a hybrid format of input and output content in PCQA into the Seq2Seq problem, including the reformulation of the numerical reasoning process as code generation. UniPCQA performs multi-task learning over all sub-tasks in PCQA and incorporates a simple ensemble strategy to alleviate the error propagation issue in the multi-task learning by cross-validating top-$k$ sampled Seq2Seq outputs. We benchmark the PACIFIC dataset with extensive baselines and provide comprehensive evaluations on each sub-task of PCQA.
研究动机与目标
- 为解决缺乏能够处理模糊查询并需要数值推理的主动式多轮金融问答系统的问题。
- 构建一个新的基准数据集 PACIFIC,支持混合上下文(表格与文本)、主动澄清与复杂数值推理。
- 定义并形式化主动式对话问答(PCQA)作为统一任务,整合澄清问题生成与对话问答。
- 提出 UniPCQA,一种统一的 Seq2Seq 框架,联合建模歧义检测、澄清问题生成与答案生成。
- 通过全面的消融实验与错误分析,评估混合输入/输出格式与数值推理在金融对话问答中的挑战。
提出的方法
- 将金融问答中的数值推理重新表述为代码生成,将算术运算与实体引用编码为可执行的 Python 代码。
- 设计一种统一的输入表示,将表格数据、文本上下文与用户查询整合为单个序列,以支持 Seq2Seq 建模。
- 定义一种统一的输出格式,支持三种响应类型:歧义预测、澄清问题与直接答案。
- 在一个单一的 Seq2Seq 模型中实现所有 PCQA 子任务(歧义检测、CQG、CQA)的多任务学习,以共享表示。
- 应用共识投票集成策略,交叉验证 top-k 生成输出,以减少多任务学习中的误差传播。
- 使用在混合 PACIFIC 数据集上微调的预训练语言模型,以处理多样化的输入模态与推理类型。
实验结果
研究问题
- RQ1统一的 Seq2Seq 框架在处理金融对话问答中的歧义检测、澄清问题生成与答案生成方面效果如何?
- RQ2将数值推理重新表述为代码生成,在涉及复杂算术的金融问答任务中,能在多大程度上提升性能?
- RQ3通过共享表示的多任务学习,能否在主动式 CQA 的多个子任务中提升性能?
- RQ4共识投票集成策略如何减轻多任务 Seq2Seq 模型在 PCQA 中的误差传播?
- RQ5当前模型在处理混合表格与文本金融上下文时,主要的失败模式与错误模式是什么?
主要发现
- PACIFIC 数据集具有显著挑战性,最先进模型仍未能达到人类水平,表明未来研究空间广阔。
- 错误分析显示,25% 的错误与澄清问题生成相关,13% 与数值计算相关,凸显了主要的失败模式。
- 与先前模型相比,与跨度抽取相关的错误比例从 84% 下降至 46%,表明推理泛化能力有所提升。
- 所提出的 UniPCQA 模型在所有子任务中均表现出色,证明了统一建模与基于代码的推理的有效性。
- 共识投票策略通过交叉验证 top-k 生成输出,提升了模型鲁棒性,减少了多任务学习中的误差传播。
- 数据集与代码已公开发布于 https://github.com/dengyang17/PACIFIC/,支持可复现性与未来基准测试。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。