Skip to main content
QUICK REVIEW

[论文解读] Revisiting Out-of-distribution Robustness in NLP: Benchmark, Analysis, and LLMs Evaluations

Lifan Yuan, Yangyi Chen|arXiv (Cornell University)|Jun 7, 2023
Topic Modeling被引用 7
一句话总结

本文提出了 BOSS,一个全面的 NLP 分布外(OOD)鲁棒性评估基准,包含 5 项任务和 20 个数据集,其 OOD 分布经过严格筛选且彼此差异显著。研究揭示了微调模型中存在三种不同的 ID-OOD 性能相关模式,表明标准鲁棒性方法相较于原始微调的增益有限,并发现采用上下文学习的 LLM 在 OOD 数据上优于微调的小型模型,尤其在 ID 数据稀缺时表现更优。

ABSTRACT

This paper reexamines the research on out-of-distribution (OOD) robustness in the field of NLP. We find that the distribution shift settings in previous studies commonly lack adequate challenges, hindering the accurate evaluation of OOD robustness. To address these issues, we propose a benchmark construction protocol that ensures clear differentiation and challenging distribution shifts. Then we introduce BOSS, a Benchmark suite for Out-of-distribution robustneSS evaluation covering 5 tasks and 20 datasets. Based on BOSS, we conduct a series of experiments on pre-trained language models for analysis and evaluation of OOD robustness. First, for vanilla fine-tuning, we examine the relationship between in-distribution (ID) and OOD performance. We identify three typical types that unveil the inner learning mechanism, which could potentially facilitate the forecasting of OOD robustness, correlating with the advancements on ID datasets. Then, we evaluate 5 classic methods on BOSS and find that, despite exhibiting some effectiveness in specific cases, they do not offer significant improvement compared to vanilla fine-tuning. Further, we evaluate 5 LLMs with various adaptation paradigms and find that when sufficient ID data is available, fine-tuning domain-specific models outperform LLMs on ID examples significantly. However, in the case of OOD instances, prioritizing LLMs with in-context learning yields better results. We identify that both fine-tuned small models and LLMs face challenges in effectively addressing downstream tasks. The code is public at \url{https://github.com/lifan-yuan/OOD_NLP}.

研究动机与目标

  • 为解决 NLP 领域缺乏标准化且具有挑战性的 OOD 基准的问题,这些基准能准确反映现实世界中的分布偏移。
  • 探究微调的预训练语言模型中,分布内(ID)与分布外(OOD)性能之间的关系。
  • 利用统一基准评估现有增强鲁棒性方法和大语言模型(LLMs)在 OOD 泛化方面的有效性。
  • 基于分布差异性和性能下降,提供构建更严格且更具代表性的 OOD 基准的协议。

提出的方法

  • 提出 OOD 基准构建的三项原则:(1)使用大规模、多样化的 ID 数据集;(2)选择来源和语义上截然不同的 OOD 数据集;(3)优先选择导致显著性能下降的分布偏移。
  • 引入 BOSS,一个基准套件,包含 5 项 NLP 任务(情感分析、毒性检测、自然语言推理、命名实体识别、抽取式问答),每项任务均配备一个 ID 数据集和三个 OOD 数据集,以确保具有挑战性且多样化的分布偏移。
  • 通过控制实验,改变模型规模、训练步数、训练样本量和可调超参数,分析 ID-OOD 性能相关性。
  • 在 BOSS 上评估五种经典 OOD 鲁棒性方法,以评估其相对于原始微调的泛化增益。
  • 测试五种 LLM,采用多种适配范式:在领域特定数据上进行微调,以及使用 ID 或 OOD 示例进行上下文学习。
  • 使用标准化模板和指令进行 LLM 推理,确保跨模型和任务的一致性评估。

实验结果

研究问题

  • RQ1不同的分布偏移特征如何影响微调 NLP 模型的泛化性能?
  • RQ2在各种模型配置下,分布内(ID)与分布外(OOD)性能之间的相关性本质是什么?
  • RQ3与原始微调相比,现有增强鲁棒性方法在标准化基准上是否显著提升了 OOD 泛化性能?
  • RQ4在数据稀缺条件下,采用上下文学习的大语言模型(LLMs)与微调的小型模型在 OOD 泛化方面有何比较?
  • RQ5ID 性能能否可靠预测 OOD 鲁棒性?在 ID-OOD 性能关系中会浮现何种模式?

主要发现

  • 识别出三种不同的 ID-OOD 性能相关模式:单调线性正相关、单调分段线性正相关和非单调 V 形,表明微调模型中存在复杂的学习动态。
  • 尽管在某些情况下取得一定增益,经典 OOD 鲁棒性方法在 BOSS 基准上并未显著优于原始微调,表明其泛化收益有限。
  • 当有足够的分布内(ID)数据时,微调的小型模型在 ID 样例上表现优于 LLM,但采用上下文学习的 LLM 在 OOD 上表现更优。
  • 对于某些任务(如情感分析),ID 与 OOD 泛化之间的性能差距随训练步数增加而扩大,表明对 ID 数据的过拟合可能损害 OOD 鲁棒性。
  • 在 CoNLL 命名实体识别数据集中,OOD 泛化最容易(ID-OOD 相关性最高),而在 WNUT 上则最难(相关性最低),凸显了任务间的 OOD 挑战差异。
  • 在抽取式问答任务中,SearchQA 数据集表现出最显著的 ID-OOD 相关性曲线变化,表明其对训练动态更为敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。