[论文解读] TABLET: Learning From Instructions For Tabular Data
本文提出了 TABLET,一个包含20个多样化表格数据集的基准,这些数据集均附有不同表述方式、粒度和专业程度的自然语言指令,用于评估大语言模型(LLMs)从指令中学习表格预测任务的能力。指令使 Flan-T5 11b 的零样本 F1 性能平均提升44%,ChatGPT 提升13%,但 LLMs 仍存在指令忠实度不足和对某些样本存在偏见的问题。
Acquiring high-quality data is often a significant challenge in training machine learning (ML) models for tabular prediction, particularly in privacy-sensitive and costly domains like medicine and finance. Providing natural language instructions to large language models (LLMs) offers an alternative solution. However, it is unclear how effectively instructions leverage the knowledge in LLMs for solving tabular prediction problems. To address this gap, we introduce TABLET, a benchmark of 20 diverse tabular datasets annotated with instructions that vary in their phrasing, granularity, and technicality. Additionally, TABLET includes the instructions' logic and structured modifications to the instructions. We find in-context instructions increase zero-shot F1 performance for Flan-T5 11b by 44% on average and 13% for ChatGPT on TABLET. Also, we explore the limitations of using LLMs for tabular prediction in our benchmark by evaluating instruction faithfulness. We find LLMs often ignore instructions and fail to predict specific instances correctly, even with examples. Our analysis on TABLET shows that, while instructions help LLM performance, learning from instructions for tabular data requires new capabilities.
研究动机与目标
- 为解决在医学和金融等隐私敏感领域中获取高质量标注表格数据的挑战。
- 探究自然语言指令是否能有效利用预训练 LLM 的世界知识进行表格预测。
- 评估 LLM 在零样本和少样本设置下从指令中学习的性能与局限性。
- 提供一个标准化的基准,包含多样化且带标注的指令,以支持未来基于指令的表格学习研究。
- 识别 LLM 在表格任务中出现的故障模式,如指令不遵守和模型偏见。
提出的方法
- 作者整理了20个表格数据集,包括10个来自 UCI ML Repository 的数据集和10个用于罕见病鉴别诊断(DDX)的数据集。
- 每个数据集均附有多条指令,其来源(如消费者 vs. 临床)、表述方式、粒度和专业程度各不相同。
- 指令进一步附带逻辑表示和反转版本,以测试指令忠实度和泛化能力。
- 该基准支持零样本和少样本评估,可比较 LLM 在有无上下文指令情况下的表现。
- 通过 Flan-T5 11b 和 ChatGPT 等模型,在零样本和少样本设置下使用 F1 分数评估性能。
- 采用基于 KNN 的少样本示例选择方法,以近似监督学习的性能上限,并与 LLM 结果进行比较。
实验结果
研究问题
- RQ1自然语言指令在多大程度上提升了 LLM 在表格预测任务上的零样本和少样本性能?
- RQ2指令表述方式、粒度和专业程度的变化如何影响 LLM 的性能和指令遵守程度?
- RQ3LLMs 对指令的忠实度如何,尤其是在面对逻辑反转或矛盾版本时?
- RQ4LLMs 在从指令学习表格预测时的主要故障模式是什么?
- RQ5在样本高效设置下,基于指令的提示能否实现接近完全监督模型的性能?
主要发现
- 在 TABLET 基准上,指令使 Flan-T5 11b 的零样本 F1 性能平均提升44%,ChatGPT 提升13%。
- 性能提升在少样本设置中最为显著,Flan-T5 11b 在提供四个上下文示例时,平均 F1 提升达44%。
- 尽管有指令帮助,LLMs 仍表现出显著偏见,即使在提供清晰指令和示例的情况下,仍会错误分类某些样本。
- 指令忠实度较低:模型经常忽略或误解指令,尤其是在逻辑被反转或为反事实情境时。
- 即使使用 KNN 和特征加权进行最优的少样本示例选择,Flan-T5 11b 的 F1 仍为0.77,远低于完全监督 KNN 模型的0.93,表明性能差距依然存在。
- 结果表明,当前 LLMs 在利用预训练知识与忠实适应任务特定指令之间难以平衡,凸显了对改进推理和指令遵循能力的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。