[论文解读] Task Ambiguity in Humans and Language Models
本文提出 AmbiBench,一个包含六个模糊指定分类任务的基准,用于研究人类与语言模型如何解决任务模糊性。研究发现,仅通过人类反馈数据微调的大语言模型才能达到或超越人类表现;而标准模型通过在少量上下文模糊示例上进行微调,可显著提升性能,实现在模糊情境下的强大泛化能力。
Language models have recently achieved strong performance across a wide range of NLP benchmarks. However, unlike benchmarks, real world tasks are often poorly specified, and agents must deduce the user's intended behavior from a combination of context, instructions, and examples. We investigate how both humans and models behave in the face of such task ambiguity by proposing AmbiBench, a new benchmark of six ambiguously-specified classification tasks. We evaluate humans and models on AmbiBench by seeing how well they identify the intended task using 1) instructions with varying degrees of ambiguity, and 2) different numbers of labeled examples. We find that the combination of model scaling (to 175B parameters) and training with human feedback data enables models to approach or exceed the accuracy of human participants across tasks, but that either one alone is not sufficient. In addition, we show how to dramatically improve the accuracy of language models trained without large-scale human feedback training by finetuning on a small number of ambiguous in-context examples, providing a promising direction for teaching models to generalize well in the face of ambiguity.
研究动机与目标
- 研究在任务规范不明确的真实世界情境中,任务模糊性如何影响人类与语言模型的表现。
- 通过引入一个针对模糊任务定义的基准,弥补现有 NLP 基准通常仅包含明确指定任务的空白。
- 评估上下文学习与微调在帮助模型泛化到模糊任务规范方面的有效性。
- 探究经过人类反馈训练的大语言模型是否能在不同指令清晰度与示例数量条件下,达到或超越人类的消歧能力。
- 展示一种可扩展的方法,提升标准语言模型处理模糊性的能力,而无需大规模人类反馈。
提出的方法
- 提出 AmbiBench,一个包含六个分类任务的基准,其指令模糊,并且每个输入具有多个显著的语言特征。
- 在两种设置下评估人类与语言模型在 AmbiBench 上的表现:(1) 指令清晰度不同的自然语言指令(信息丰富 vs. 信息贫乏),(2) 上下文标注示例数量不同(1 至 20 个)。
- 在不同指令与示例条件下,训练并评估一系列语言模型,包括 GPT-3 变体(如 davinci、text-davinci-002)和较小模型(如 ada、curie)。
- 在少量模糊上下文示例上对标准语言模型(如 davinci)进行微调,以提升其消歧能力。
- 通过控制实验,每组示例仅让一个特征变化,以隔离微调数据中模糊性的影响。
- 将模型表现与人类参与者及贝叶斯最优模型进行比较,以评估相对表现与泛化能力。
实验结果
研究问题
- RQ1在指令不明确的真实世界类情境中,语言模型与人类在解决任务模糊性时的表现如何?
- RQ2模型规模扩大或使用人类反馈数据在多大程度上能提升模型的意图消歧能力?
- RQ3在少量模糊上下文示例上对标准语言模型进行微调,是否能显著提升其消歧准确率?
- RQ4上下文中的多个模糊示例是否能带来比稀疏或无示例更好的泛化效果?
- RQ5在未见过的模糊任务上,微调后的标准模型表现与经过人类反馈训练的大模型相比如何?
主要发现
- 经过人类反馈数据微调的大语言模型(如 text-davinci-002)在所有模糊任务条件下,表现与人类参与者相当或更优。
- 未经人类反馈微调的标准语言模型(如 davinci)在模糊任务中表现较差,尤其在指令信息贫乏或示例稀少时。
- 仅在 20 个模糊上下文示例上进行微调,即可显著提升标准模型的性能,使其在未见过的模糊任务上超越人类反馈训练模型的表现。
- 模型规模扩大与人类反馈的结合是实现高性能的必要条件;仅靠任一因素均不足以实现人类水平的消歧能力。
- 随着上下文示例数量的增加,性能有所提升,但最显著的增益来自在模糊示例上进行微调,而非仅增加示例数量。
- 控制实验确认,微调带来的性能提升源于对模糊性的学习能力,而非仅接触多样化的句式结构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。