[论文解读] Multi-View Graph Representation Learning for Answering Hybrid Numerical Reasoning Question
该论文提出多视图图(MVG)表征学习方法,通过保留表格结构并建模多粒度证据,以增强表格-文本混合问答任务。通过构建表格视图、关系视图和数值视图,并结合多视图注意力机制,该模型在财务报告推理任务中表现优异,在TAT-QA数据集上达到74.5 EM和81.5 F1,分别优于SOTA模型0.6和1.1个百分点。
Hybrid question answering (HybridQA) over the financial report contains both textual and tabular data, and requires the model to select the appropriate evidence for the numerical reasoning task. Existing methods based on encoder-decoder framework employ a expression tree-based decoder to solve numerical reasoning problems. However, encoders rely more on Machine Reading Comprehension (MRC) methods, which take table serialization and text splicing as input, damaging the granularity relationship between table and text as well as the spatial structure information of table itself. In order to solve these problems, the paper proposes a Multi-View Graph (MVG) Encoder to take the relations among the granularity into account and capture the relations from multiple view. By utilizing MVGE as a module, we constuct Tabular View, Relation View and Numerical View which aim to retain the original characteristics of the hybrid data. We validate our model on the publicly available table-text hybrid QA benchmark (TAT-QA) and outperform the state-of-the-art model.
研究动机与目标
- 解决将表格展平为编码器输入时导致的表格结构退化和空间关系丢失问题。
- 通过区分细胞、表头和跨度等元素在推理中的作用,改进对多粒度证据(如单元格、表头、跨度)的建模。
- 通过保留文本与表格之间结构和语义关系,提升金融问答中的数值推理性能。
- 通过可学习的注意力机制整合多种证据视图,实现根据上下文动态加权各视图的贡献。
- 在TAT-QA基准上超越现有模型,解决混合数值推理问题。
提出的方法
- 构建表格视图,通过将行与列之间的关系建模为图边,以保留表格的二维行列结构。
- 设计关系视图,将文本和表格元素(句子、行、列、数字、词语节点)统一为单一图,以捕捉跨模态关系。
- 创建数值视图,专注于细粒度数字节点及其与粗粒度表头的对齐,以提升数量表示能力。
- 采用多视图注意力网络,动态评估每个视图对每个节点的贡献,实现多粒度信号的自适应融合。
- 使用序列标注模块处理基于跨度的答案,使用序列到树解码器处理数值表达式生成,分别应对$Q_S$和$Q_N$类问题。
- 端到端训练,结合交叉熵损失与树结构损失,以同时优化跨度抽取与表达式树生成。
实验结果
研究问题
- RQ1保留表格的二维结构是否能提升混合问答任务中的推理性能?
- RQ2在数值推理中,如何有效建模并区分多粒度证据(如行表头、列表头、单个数字)?
- RQ3具有视图特定注意力的多视图图表示是否优于单视图或展平输入编码?
- RQ4在金融数值推理任务中,模型性能在多大程度上依赖于准确的量级和操作符预测?
- RQ5具有视图特定表示的统一编码器是否能在TAT-QA上超越现有的GNN或Transformer-based编码器?
主要发现
- MVG模型在TAT-QA开发集上达到74.5 EM和81.5 F1,分别优于SOTA模型0.6和1.1个百分点。
- 消融实验表明,移除多视图注意力机制会使EM下降1.6个百分点,证实其在视图融合中的关键作用。
- 模型在量级预测性能上显著提升,当使用真实量级输入时,EM达到84.4%,表明量级预测是主要瓶颈。
- 仅使用真实操作符时性能仅小幅提升(EM +0.2),表明模型的基于类别解码策略具有鲁棒性,不易受误差传播影响。
- 数值视图对性能贡献最大,尤其在复杂算术推理任务中,凸显细粒度数字表示的价值。
- 模型展现出强大的泛化能力,在开发集和测试集上均保持一致的性能提升,验证了其在真实金融问答任务中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。