[论文解读] TAT-QA: A Question Answering Benchmark on a Hybrid of Tabular and Textual Content in Finance
本论文提出 TAT-QA,一个大规模、真实世界的金融问答基准,结合了表格和文本数据,要求复杂的数值推理。该研究提出 TagOp 模型,通过序列标注从表格和文本中提取证据,再运用符号推理与聚合操作符计算答案,F1 得分为 58.0%,较先前基线模型提升 11.1%,但仍远低于人类表现(90.8% F1),凸显了混合数据问答中数值推理的挑战。
Hybrid data combining both tabular and textual content (e.g., financial reports) are quite pervasive in the real world. However, Question Answering (QA) over such hybrid data is largely neglected in existing research. In this work, we extract samples from real financial reports to build a new large-scale QA dataset containing both Tabular And Textual data, named TAT-QA, where numerical reasoning is usually required to infer the answer, such as addition, subtraction, multiplication, division, counting, comparison/sorting, and the compositions. We further propose a novel QA model termed TAGOP, which is capable of reasoning over both tables and text. It adopts sequence tagging to extract relevant cells from the table along with relevant spans from the text to infer their semantics, and then applies symbolic reasoning over them with a set of aggregation operators to arrive at the final answer. TAGOPachieves 58.0% inF1, which is an 11.1% absolute increase over the previous best baseline model, according to our experiments on TAT-QA. But this result still lags far behind performance of expert human, i.e.90.8% in F1. It is demonstrated that our TAT-QA is very challenging and can serve as a benchmark for training and testing powerful QA models that address hybrid form data.
研究动机与目标
- 为解决缺乏大规模、真实世界、结合表格与文本金融数据且具备数值推理需求的问答数据集的问题。
- 构建一个能捕捉财务报告中表格与描述性文本之间紧密语义与数值依赖关系的基准。
- 提出一种可在混合数据上进行推理的模型,整合来自表格与文本的证据,以获得准确的数值答案。
- 通过展示模型性能(58.0% F1)与人类专家性能(90.8% F1)之间的显著差距,凸显混合数据问答中数值推理的难度。
- 提供公开数据集与基线模型,推动多模态、混合金融场景下数值推理的研究。
提出的方法
- TAT-QA 数据集从 182 份真实财务报告中构建,提取包含表格(含行/列标题与数值数据)与至少两段描述性段落的混合上下文。
- 具备金融专业背景的标注员生成需进行数值推理的问题——如加法、减法、乘法、除法、计数与比较——并提供完整的推导步骤。
- TagOp 使用序列标注识别相关表格单元格与文本片段作为证据,利用其语义与数值关系。
- 模型通过一组预定义的聚合操作符(如求和、差值、比率)进行符号推理,从提取的证据中计算最终答案。
- 引入多分类分类器以预测数值答案的量级(如百万、十亿),这些量级通常隐含在标题或文本中。
- 该框架在 2,757 个混合上下文的 16,552 个问题上进行评估,性能通过 F1 分数衡量,并对证据提取、计算与量级预测进行误差分析。
实验结果
研究问题
- RQ1问答系统如何有效从财务报告的表格与文本两部分中提取并整合证据?
- RQ2在金融领域数值问答中,对结构化与非结构化数据进行符号推理对性能有何影响?
- RQ3当前模型在混合金融数据推理方面失败的程度如何?主要错误来源是什么?
- RQ4统一的模型架构是否能比以往方法更有效地处理混合上下文中的证据提取与数值推理?
- RQ5所提出模型在真实世界金融问答任务中的表现与人类专家相比如何?
主要发现
- TAT-QA 包含从 182 份真实财务报告中提取的 16,552 个问题,涵盖 2,757 个混合上下文,对数值推理与推导步骤有强依赖。
- TagOp 在 TAT-QA 上取得 58.0% 的 F1,较最佳基线模型提升 11.1 个百分点绝对值。
- 人类专家达到 90.8% 的 F1,表明性能差距显著,凸显 TAT-QA 基准的高挑战性。
- 主要错误来源(84%)为错误的证据提取——其中 55% 属于错误证据,29% 属于遗漏证据——凸显了联合理解表格与文本的难度。
- 大量错误(55%)源于错误的证据选择,9% 来自错误计算,4% 来自无依据的计算,表明推理过程存在缺陷。
- 量级预测错误占 3% 的错误比例,表明即使在 TagOp 中显式建模量级,建模数量级(如百万、十亿)仍具非平凡挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。