Skip to main content
QUICK REVIEW

[论文解读] GLUE-X: Evaluating Natural Language Understanding Models from an Out-of-distribution Generalization Perspective

Linyi Yang, Shuibai Zhang|arXiv (Cornell University)|Nov 15, 2022
Topic Modeling被引用 10
一句话总结

本文提出 GLUE-X,一个统一的基准,用于在 15 个公开数据集和 8 项 NLP 任务上评估预训练语言模型(PLMs)在分布外(OOD)设置下的泛化能力。研究发现所有模型在 OOD 设置下性能均出现显著下降,凸显了提升 OOD 泛化鲁棒性的紧迫需求,并表明模型架构与微调策略对跨领域性能具有显著影响。

ABSTRACT

Pre-trained language models (PLMs) are known to improve the generalization performance of natural language understanding models by leveraging large amounts of data during the pre-training phase. However, the out-of-distribution (OOD) generalization problem remains a challenge in many NLP tasks, limiting the real-world deployment of these methods. This paper presents the first attempt at creating a unified benchmark named GLUE-X for evaluating OOD robustness in NLP models, highlighting the importance of OOD robustness and providing insights on how to measure the robustness of a model and how to improve it. The benchmark includes 13 publicly available datasets for OOD testing, and evaluations are conducted on 8 classic NLP tasks over 21 popularly used PLMs, including GPT-3 and GPT-3.5. Our findings confirm the need for improved OOD accuracy in NLP tasks, as significant performance degradation was observed in all settings compared to in-distribution (ID) accuracy.

研究动机与目标

  • 解决 NLP 模型在分布外(OOD)泛化能力评估方面缺乏统一基准的问题。
  • 研究在不同 NLP 任务中,与分布内(ID)性能相比,OOD 设置下的性能退化程度。
  • 分析预训练模型架构与微调策略对 OOD 泛化鲁棒性的影响。
  • 从特征层面揭示影响 OOD 泛化的内部因素。
  • 通过创建公开可用、标准化的基准,为 NLP 领域泛化研究奠定基础。

提出的方法

  • 构建 GLUE-X,整合来自多个领域的 8 项标准 NLP 任务的 15 个公开 OOD 数据集。
  • 确保每项任务均包含至少两个不同的分布外测试领域,以支持跨分布评估。
  • 在所有任务中,以一致的实验条件评估 21 种流行的预训练语言模型(PLMs)。
  • 应用三种微调策略:线性探针、微调和线性探针后接微调(LP-FT),以评估其对 OOD 性能的影响。
  • 对模型特征进行事后分析,识别导致 OOD 泛化成功或失败的内部原因。
  • 通过分析 ID 与 OOD 性能之间的相关性,评估是否能从分布内结果预测 OOD 泛化性能。

实验结果

研究问题

  • RQ1当前预训练语言模型在分布外数据上的性能相较于分布内数据下降了多少?
  • RQ2不同的预训练模型架构与参数规模在多大程度上影响 OOD 泛化性能?
  • RQ3在多种 NLP 任务中,哪种微调策略——线性探针、微调或 LP-FT——能带来最佳的 OOD 泛化鲁棒性?
  • RQ4在不同任务与数据集中,ID 与 OOD 性能之间的相关性如何?
  • RQ5哪些内部模型特征或特征层面的模式有助于或阻碍 NLP 模型的 OOD 泛化?

主要发现

  • 所有评估的模型在 OOD 数据上均表现出显著的性能下降,其中 COLA 任务的性能下降最为严重,表明存在关键的鲁棒性缺口。
  • 大多数任务中,ID 与 OOD 性能呈线性相关,但相关性的强弱显著取决于 OOD 数据集的选择。
  • 判别式模型(如 RoBERTa、BERT)的 ID 与 OOD 性能之间表现出更强的线性相关性,而生成式模型(如 GPT-2 变体)则较弱,表明架构差异会影响泛化可预测性。
  • LP-FT 微调策略在 OOD 准确率上相比标准微调略有但一致的提升,表明其可能是增强鲁棒性的潜在路径。
  • 使用相同架构预训练的模型(如 ELECTRA-small 和 ELECTRA-large)在 OOD 性能上表现相似,表明架构与规模是决定鲁棒性的关键因素。
  • 在 MRPC 数据集上观察到 ID 与 OOD 性能的负相关性,表明任务特定的数据稀疏性与分布偏移可能导致反直觉的性能表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。