[论文解读] RAFT: A Real-World Few-Shot Text Classification Benchmark
RAFT 引入了一个现实世界中的 few-shot 文本分类基准,使用自然发生的任务,这些任务与实际研究助理的工作相匹配,每个任务包含 50 个训练样本,并采用模拟实际部署的评估设置。结果显示,即使非专家人类在平均 F1 上也比 GPT-3 高出 0.11,凸显了当前模型在长文本推理和多分类任务方面面临的挑战。
Large pre-trained language models have shown promise for few-shot learning, completing text-based tasks given only a few task-specific examples. Will models soon solve classification tasks that have so far been reserved for human research assistants? Existing benchmarks are not designed to measure progress in applied settings, and so don't directly answer this question. The RAFT benchmark (Real-world Annotated Few-shot Tasks) focuses on naturally occurring tasks and uses an evaluation setup that mirrors deployment. Baseline evaluations on RAFT reveal areas current techniques struggle with: reasoning over long texts and tasks with many classes. Human baselines show that some classification tasks are difficult for non-expert humans, reflecting that real-world value sometimes depends on domain expertise. Yet even non-expert human baseline F1 scores exceed GPT-3 by an average of 0.11. The RAFT datasets and leaderboard will track which model improvements translate into real-world benefits at https://raft.elicit.org .
研究动机与目标
- 创建一个反映人类研究助理在现实世界中执行的 few-shot 文本分类任务的基准。
- 在尽可能贴近真实部署条件的设置下评估 few-shot 学习性能,包括长输入文本和复杂指令。
- 识别当前语言模型在长文档推理和高基数分类任务处理方面的局限性。
- 建立人类在现实世界任务上的基线表现,以衡量向人类水平 few-shot 分类迈进的进展。
- 提供公开排行榜和数据集,以追踪可转化为实际现实效益的模型改进。
提出的方法
- 该基准包含从真实研究工作流中收集的 11 个自然发生的文本分类数据集,每个数据集包含 50 个标注的训练样本和一个更大的未标注测试集。
- 每个任务包含自然语言指令和标签,评估通过 Hugging Face 托管的排行榜进行,使用私有测试标签。
- 人类基线通过众包收集,采用两阶段流程:资格测试(20 个样本)和完整标注(100 个样本),使用多数投票解决标签冲突。
- 自动基线通过 GPT-3 和集成方法(如使用 n-gram 特征的 AdaBoost)进行评估,超参数通过留一法交叉验证进行调优。
- 评估设置避免封闭书限制,使用信息丰富且非二元的标签,以更好地反映现实世界任务的复杂性。
- 鼓励使用未标注样本进行无监督预训练和开放域检索,以模拟真实的部署条件。
实验结果
研究问题
- RQ1当前的 few-shot 语言模型能否在通常外包给人类研究助理的真实世界文本分类任务上达到人类表现?
- RQ2模型在需要对长输入文本进行推理的任务上的表现如何,这类任务在现实应用中很常见?
- RQ3模型在 few-shot 学习方面的能力在多大程度上能泛化到高基数分类任务?
- RQ4人类在这些任务上的表现与最先进模型相比如何,特别是在 F1 分数和领域专业知识依赖性方面?
- RQ5评估设置中的哪些组件(例如标签信息量、检索访问权限)对模型性能估计的影响最大?
主要发现
- 在该基准上,非专家人类基线在平均 F1 上比 GPT-3 高出 0.11,表明当前模型在真实世界的 few-shot 任务中仍存在不足。
- 当前模型在长输入文本推理方面表现显著不佳,这在包含长文档的数据集中表现尤为明显。
- 高类别数的任务(例如 10 个及以上类别)构成重大挑战,模型在这些任务上的 F1 分数明显低于简单多分类任务。
- 在某些数据集上,众包人类基线难以收集,特别是那些需要领域专业知识的任务,表明现实世界价值往往依赖于专业知识。
- 使用 AdaBoost 和 n-gram 的自动基线在某些任务上表现强劲,但仍落后于人类基线,尤其是在长上下文和高基数任务上。
- RAFT 基准和排行榜(https://raft.elicit.org)已公开,可用于追踪真实世界中 few-shot 文本分类的模型改进。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。