[论文解读] Towards Zero-Shot and Few-Shot Table Question Answering using GPT-3
本论文探讨了在不进行微调的情况下,利用 GPT-3 实现零样本和少样本表格问答,证明 GPT-3 能够理解序列化 JSON 表示形式的表格数据,并回答自然语言问题。通过使用少样本示例进行提示工程,准确率从零样本的 73.6% 显著提升至 86.8%,该结果基于一个全新的报纸信息图表格数据集。
We present very early results on using GPT-3 to perform question answering on tabular data. We find that stock pre-trained GPT-3 is able to zero-shot learn the table structure from a serialized JSON array-of-arrays representation, and able to answer lookup queries and simple comparison questions in natural language without any fine-tuning. We further find that simple prompt engineering to include few-shot static Q&A examples significantly improves accuracy. Lastly, we find that intermixing passage text improves accuracy even further on heterogeneous data. We apply our approach on a novel dataset of simple tables in newspaper infographics with promising results. Overall, we find much cause for optimism in this basic approach.
研究动机与目标
- 探究 GPT-3 是否能够利用其上下文学习能力,在不进行微调的情况下完成表格问答任务。
- 评估使用少样本示例进行提示工程在提升 GPT-3 表格问答任务性能方面的有效性。
- 探究在异构数据源(如表格与文本)混合时,上下文文本对 GPT-3 问答能力的影响。
- 构建并发布一个全新的报纸信息图简单表格数据集,以供未来表格问答研究使用。
- 评估像 GPT-3 这类基础模型在可访问性数据解读方面的潜力,尤其针对视障用户和 K-6 年级教育场景。
提出的方法
- 使用表格的序列化 JSON 表示、来自 OCR 的非结构化段落文本以及自然语言问题构建提示。
- 对未经修改的预训练 GPT-3 模型应用零样本推理,不进行任何微调,以完成表格问答任务。
- 通过添加来自同一类别(如体育、天气)但与目标表格无关的少样本合成 Q&A 示例来增强提示。
- 使用微调后的 T5 模型生成合成 Q&A 对,涵盖表格列上的基本统计查询(最小值、最大值、均值)。
- 使用目标检测(Faster R-CNN)和 OCR(Azure Form Recognizer)从报纸信息图图像中提取表格和段落文本。
- 使用微调后的 RoBERTa 模型对表格进行分类(天气、体育、金融、其他),以确保下游提示工程的一致性。
实验结果
研究问题
- RQ1GPT-3 是否能够在不进行任何微调的情况下,对表格数据执行零样本表格问答?
- RQ2少样本提示在多大程度上提升了 GPT-3 回答基于表格问题的准确率?
- RQ3在异构表格与文本问答任务中,包含周围段落文本如何影响 GPT-3 的表现?
- RQ4GPT-3 的零样本性能与微调后的模型(如 TAPAS)在全新信息图表格数据集上的表现相比如何?
- RQ5合成的少样本示例是否能有效泛化,从而提升在未见表格问答任务上的零样本性能?
主要发现
- GPT-3 在未进行任何微调的情况下,对 12 张信息图表格的小型测试集实现了 73.6% 的零样本准确率。
- 通过使用合成 Q&A 示例进行少样本提示,准确率提升至 86.8%,显著优于零样本设置和微调后的 TAPAS 模型(18.4%)。
- GPT-3 展现出从序列化 JSON 输入中理解表格结构的能力,并能正确回答查找和比较类问题。
- 即使表格嵌入在非结构化文本中,模型也能成功定位相关单元格和段落文本以回答问题。
- 将段落文本与表格数据交错呈现可提升答案准确率,表明上下文定位有助于增强推理能力。
- 尽管零样本表现强劲,部分失败案例(如错误识别最小值或球员排名)通过少样本提示得以解决。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。