[论文解读] Large Language Models are few(1)-shot Table Reasoners
该论文表明,像 GPT-3 这样的大语言模型(LLMs)仅通过一次示例的上下文学习与思维链(chain-of-thought)提示,即可执行复杂的表格推理任务,如问答和事实验证。尽管未在表格数据上进行预训练,LLMs 仍表现出强劲性能(例如,在 TabFact 上达到 78.8%,在 WikiTableQuestions 上达到 48.8%),优于微调过的 T5-large 模型在长文本生成任务中的表现,并生成高度忠实于表格语义的推理链。
Recent literature has shown that large language models (LLMs) are generally excellent few-shot reasoners to solve text reasoning tasks. However, the capability of LLMs on table reasoning tasks is yet to be explored. In this paper, we aim at understanding how well LLMs can perform table-related tasks with few-shot in-context learning. Specifically, we evaluated LLMs on popular table QA and fact verification datasets like WikiTableQuestion, FetaQA, TabFact, and FEVEROUS and found that LLMs are competent at complex reasoning over table structures, though these models are not pre-trained on any table corpus. When combined with `chain of thoughts' prompting, LLMs can achieve very strong performance with only a 1-shot demonstration, even on par with some SoTA models. We show that LLMs are even more competent at generating comprehensive long-form answers on FetaQA than tuned T5-large. We further manually studied the reasoning chains elicited from LLMs and found that these reasoning chains are highly consistent with the underlying semantic form. We believe that LLMs can serve as a simple yet generic baseline for future research. The code and data are released in https://github.com/wenhuchen/TableCoT.
研究动机与目标
- 探究大语言模型(LLMs)是否可在无需特定任务微调的情况下执行复杂的表格推理任务。
- 评估少样本上下文学习结合思维链提示在基于表格的任务中的有效性。
- 比较 LLM 与微调模型(如 T5-large)在长文本答案生成和事实验证任务中的表现。
- 分析 LLM 生成的推理链与真实语义形式之间的一致性与忠实度。
- 识别 LLM 在处理大型表格和符号运算时的局限性。
提出的方法
- 采用少样本上下文学习,仅通过一个示例引导 LLM 执行表格推理任务。
- 应用思维链(CoT)提示,以在预测前激发逐步推理过程。
- 使用自一致性(CoT+SC)通过集成解码提升推理的可靠性。
- 在四个基准数据集上评估 LLM:WikiTableQuestions、FetaQA、TabFact 和 FEVEROUS。
- 通过人工评估衡量推理链的忠实度与正确性。
- 分析模型在不同大小表格上的表现,以识别可扩展性限制。
实验结果
研究问题
- RQ1LLMs 是否仅通过一次示例的上下文学习即可执行复杂的表格推理任务,而无需微调?
- RQ2思维链提示对 LLM 在表格问答与事实验证任务中的表现有何影响?
- RQ3LLM 生成的推理链与真实语义形式相比,在忠实度与正确性方面如何?
- RQ4表格大小对 LLM 推理性能有何影响?
- RQ5LLM 在长文本答案生成任务中与微调模型(如 T5-large)相比表现如何?
主要发现
- LLMs 仅通过一次示例的上下文学习与思维链提示,在 WikiTableQuestions 上达到 48.8% 的精确匹配,在 TabFact 上达到 78.8%。
- 在 FetaQA 上,GPT-3 在人工评估中对长文本答案的正确性与充分性评分超过微调过的 T5-large 超过 30%。
- 约 90% 的 LLM 生成的推理链忠实于表格内容,仅有不到 10% 出现幻觉现象。
- 当表格超过 1,000 个 token 时,模型性能显著下降,接近随机水平,表明对表格大小极为敏感。
- LLMs 展现出强大的符号推理能力,包括计数、比较与算术运算,尤其在处理表格时。
- 尽管在小到中型表格上表现优异,LLMs 仍受限于 token 上下文长度,在大规模或确定性任务中尚无法取代符号方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。