[论文解读] TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data
TAT-LLM 是在 LLaMA 2 上微调的专用语言模型,通过三步流程(提取器、推理器、执行器)对表格和文本数据执行离散推理。它在 FinQA、TAT-QA 和 TAT-DQA 基准测试中表现优于较小的基础模型以及 GPT-4 等大模型,表明任务特定的专门化可使小型模型达到甚至超越远大于其规模的模型的推理性能。
In this work, we address question answering (QA) over a hybrid of tabular and textual data that are very common content on the Web (e.g. SEC filings), where discrete reasoning capabilities are often required. Recently, large language models (LLMs) like GPT-4 have demonstrated strong multi-step reasoning capabilities. We then consider harnessing the amazing power of LLMs to solve our task. We abstract a Step-wise Pipeline for tabular and textual QA, which consists of three key steps, including Extractor, Reasoner and Executor, and initially design an instruction to instantiate the pipeline and validate that GPT-4 outperforms all existing methods. However, utilizing an online LLM like GPT-4 holds various challenges in terms of cost, latency, and data security risk, which motivates us to specialize smaller LLMs in this task. We develop a TAT-LLM language model by fine-tuning LLaMA 2 with the training data generated automatically from existing expert-annotated datasets following the Step-wise Pipeline. The experimental results have verified that our TAT-LLM model can outperform all baseline models, including the previous best fine-tuned models and very large-scale LLMs like GPT-4 on FinQA, TAT-QA and TAT-DQA benchmarks.
研究动机与目标
- 为解决在混合表格和文本数据上进行问题回答的挑战,该挑战需要复杂的离散推理,如算术运算、比较和计数。
- 通过将问答分解为具有独立推理阶段的结构化、分步流程,克服直接生成答案的局限性。
- 通过为该任务专门化较小的模型,开发一种成本更低、更安全且性能更高的替代方案,以替代 GPT-4 等大型在线 LLM。
- 验证通过使用专家标注数据集自动生成的数据对 LLaMA 2 进行微调,可在表格和文本问答任务上实现更优性能。
提出的方法
- TAT-LLM 模型基于通过分步流程从专家标注的表格和文本问答数据集生成的合成数据集,在 LLaMA 2 上进行微调。
- 该流程包含三个阶段:提取器(识别相关证据)、推理器(生成逻辑或数学表达式)和执行器(执行表达式以得出答案)。
- 每个训练样本以指令、表格、文本、问题和响应的结构组织,响应以分步输出的结构化表格格式呈现。
- 集成外部执行器以确保数学和逻辑运算的精确执行,提高可靠性并减少计算错误。
- 模型被训练为以结构化、人类可读的格式生成多步推理输出,从而支持更好的评估与优化。
- 训练数据通过将该流程应用于现有专家标注的问答示例自动生成,确保与所需推理结构的一致性。

实验结果
研究问题
- RQ1专用的小型语言模型是否能在表格和文本数据的离散推理中超越 GPT-4 等大型通用 LLM?
- RQ2包含提取器、推理器和执行器的分步流程架构在提升混合数据问答推理准确性方面有多有效?
- RQ3在自动生成的、流程结构化的数据上对 LLaMA 2 进行微调,能在多大程度上提升其在表格和文本问答基准上的表现?
- RQ4集成外部执行器在提升推理流程中数学和逻辑运算的可靠性方面有何作用?
- RQ5推理流程中的主要错误来源是什么?通过模型专门化和数据增强,这些错误在多大程度上可以被缓解?
主要发现
- TAT-LLM(7B)在 FinQA、TAT-QA 和 TAT-DQA 基准测试中优于所有基线模型,包括先前最佳的微调模型和 GPT-4。
- 与 LLaMA 2-Chat(7B)相比,TAT-LLM 在 TAT-QA 的计数类问题上实现 109.1% 的相对性能提升,在 TAT-DQA 的算术类问题上提升超过 200%。
- 外部执行器显著减少了执行错误,尤其是在算术和逻辑运算中,对推理密集型任务的性能提升贡献显著。
- 错误分析显示,48% 的错误源于提取器阶段,主要由于错误的证据选择,表明在精确理解表格和文本内容方面仍存在关键挑战。
- TAT-LLM(7B)与 LLaMA 2-Chat(7B)之间的性能差距在算术和计数类问题上最为显著,提升超过 100%;在跨度和多跨度类型问题上,提升仍超过 30%。
- 即使未使用外部执行器的 70B 参数版本 TAT-LLM,其在各数据集上的 EM 指标下降也未超过 7 个百分点,表明大模型本身具备更强的推理能力,但外部执行器仍能显著提升精度。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。