[论文解读] WANLI: Worker and AI Collaboration for Natural Language Inference Dataset Creation
本文提出 WaNLI,一种人机协作框架,通过使用 GPT-3 基于数据集制图识别出的具有挑战性的推理模式生成示例,随后进行自动化过滤与人工修订,从而创建多样化、高质量的自然语言蕴含(NLI)数据集。该数据集包含 107,885 个样本,在 HANS 上使模型准确率提高 11%,在 Adversarial NLI 上提高 9%,相较于在四倍大的 MultiNLI 上训练的模型表现更优。
A recurring challenge of crowdsourcing NLP datasets at scale is that human writers often rely on repetitive patterns when crafting examples, leading to a lack of linguistic diversity. We introduce a novel approach for dataset creation based on worker and AI collaboration, which brings together the generative strength of language models and the evaluative strength of humans. Starting with an existing dataset, MultiNLI for natural language inference (NLI), our approach uses dataset cartography to automatically identify examples that demonstrate challenging reasoning patterns, and instructs GPT-3 to compose new examples with similar patterns. Machine generated examples are then automatically filtered, and finally revised and labeled by human crowdworkers. The resulting dataset, WANLI, consists of 107,885 NLI examples and presents unique empirical strengths over existing NLI datasets. Remarkably, training a model on WANLI improves performance on eight out-of-domain test sets we consider, including by 11% on HANS and 9% on Adversarial NLI, compared to training on the 4x larger MultiNLI. Moreover, it continues to be more effective than MultiNLI augmented with other NLI datasets. Our results demonstrate the promise of leveraging natural language generation techniques and re-imagining the role of humans in the dataset creation process.
研究动机与目标
- 解决众包 NLP 数据集中语言多样性不足以及对虚假模式过拟合的问题。
- 探索一种新的数据集构建范式,利用语言模型进行生成,人类负责评估与修订。
- 通过强调罕见且具有挑战性的推理模式,提升模型的泛化能力。
- 重新定义人类标注者的作用,使其从主要创建者转变为 AI 生成内容的评估者与修订者。
- 开发一种可扩展、自动化的流水线,以最小的人力投入生成多样化、高质量的 NLI 示例。
提出的方法
- 利用数据集制图技术,在 MultiNLI 中识别出相对于已训练模型表现出具有挑战性推理模式的‘区域’。
- 使用 GPT-3 作为数据生成器,通过为每个识别出的模式组提供上下文示例进行提示,生成新的、符合模式的一致性 NLI 实例。
- 提出一种受数据集制图启发的新度量标准,用于自动过滤低质量或无信息量的 GPT-3 生成结果。
- 将过滤后的 AI 生成示例提交给人类众包工作者进行金标准标注,并可选地进行修订,以确保质量与正确性。
- 将修订并标注的示例聚合为最终数据集 WaNLI,共包含 107,885 个 NLI 实例。
- 通过在 WaNLI 上微调模型,并在分布外基准(包括 HANS 和 Adversarial NLI)上进行测试,评估所生成数据集的效果。
实验结果
研究问题
- RQ1基于识别出的推理模式生成的 AI 示例,是否能提升模型在分布外 NLI 基准上的泛化能力?
- RQ2一种强调人类评估而非人类生成的人机协作流水线,是否能产生更丰富多样且更具鲁棒性的 NLP 数据集?
- RQ3在 WaNLI 上微调的模型性能,与在更大规模传统数据集(如 MultiNLI)上训练的模型相比如何?
- RQ4基于数据集制图度量的自动化过滤,能在多大程度上减少对大量人工审查的依赖,同时保持数据质量?
- RQ5AI 生成数据在偏见与人工痕迹传播方面存在哪些局限性?人类监督在缓解这些问题方面发挥何种作用?
主要发现
- 在 WaNLI 上训练的模型相较于在四倍大的 MultiNLI 数据集上训练的模型,在 HANS 基准上准确率提高了 11%。
- WaNLI 在 Adversarial NLI 基准上使模型性能相比 MultiNLI 训练的模型提升了 9%,表明其对对抗性样本具有更强的鲁棒性。
- 即使在 MultiNLI 增强了其他 NLI 数据集的情况下,基于 WaNLI 微调的模型仍表现更优,表明 WaNLI 具有独特的实证价值。
- 人工修订步骤显著提升了 AI 生成示例的质量,标注者纠正了错误并优化了措辞,确保语言正确性与标签准确性。
- 该流水线成功识别并复现了罕见的推理模式,如否定、反转和隐含意图等,在传统众包数据集中这些模式通常代表性不足。
- 尽管使用了 GPT-3,最终数据集在人类标注者确认后显示极少有毒或冒犯性内容,因为标注者在修订过程中已主动剔除此类示例。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。