Skip to main content
QUICK REVIEW

[论文解读] Do Fine-tuned Commonsense Language Models Really Generalize?

Mayank Kejriwal, Ke Shen|arXiv (Cornell University)|Nov 18, 2020
Topic Modeling参考文献 50被引用 7
一句话总结

本文研究了微调后的常识语言模型是否真正能够在多种常识推理基准上实现泛化。通过五个主要基准、严格的控制条件和统计分析,作者发现当模型在分布外数据集上评估时,性能出现显著下降,揭示了强烈的数据集偏差和有限的泛化能力,尽管在排行榜上的域内准确率超过80%。

ABSTRACT

Recently, transformer-based methods such as RoBERTa and GPT-3 have led to significant experimental advances in natural language processing tasks such as question answering and commonsense reasoning. The latter is typically evaluated through multiple benchmarks framed as multiple-choice instances of the former. According to influential leaderboards hosted by the Allen Institute (evaluating state-of-the-art performance on commonsense reasoning benchmarks), models based on such transformer methods are approaching human-like performance and have average accuracy well over 80% on many benchmarks. Since these are commonsense benchmarks, a model that generalizes on commonsense reasoning should not experience much performance loss across multiple commonsense benchmarks. In this paper, we study the generalization issue in detail by designing and conducting a rigorous scientific study. Using five common benchmarks, multiple controls and statistical analysis, we find clear evidence that fine-tuned commonsense language models still do not generalize well, even with moderate changes to the experimental setup, and may, in fact, be susceptible to dataset bias. We also perform selective studies, including qualitative and consistency analyses, to gain deeper insight into the problem.

研究动机与目标

  • 探究微调后的常识语言模型在不同推理基准之间是否具备稳健的泛化能力。
  • 识别可能导致排行榜上报告性能被高估的数据集偏差潜在来源。
  • 通过受控的跨基准评估,评估最先进模型的鲁棒性。
  • 提供实证证据,表明在某一基准上取得高准确率并不意味着在其他基准上具备强泛化能力。
  • 提醒研究社区避免将排行榜结果过度解读为具备类人常识推理能力的证据。

提出的方法

  • 在五个不同的常识推理基准上微调 RoBERTa-base:HellaSwag、PIQA、Social IQA、aNLI 和 CommonsenseQA。
  • 将每个域内模型在全部五个基准上进行评估,以衡量跨领域性能损失。
  • 通过比较域内与域外模型在相同测试实例上的预测结果,开展一致性分析。
  • 对域内模型成功而所有域外模型均相同错误预测的案例进行定性分析。
  • 使用统计分析评估性能下降和一致性模式的显著性。
  • 提出一种潜在的“选项偏差”假设,即仅凭答案选项本身可能驱动模型预测,而无需完全理解问题。

实验结果

研究问题

  • RQ1微调后的常识语言模型在不同常识推理基准之间的泛化程度如何?
  • RQ2当在某一基准上训练的模型在另一基准上进行评估时,性能下降的幅度有多大?
  • RQ3是否存在系统性的模型失败模式,提示存在数据集偏差或表面化学习?
  • RQ4所有域外模型在相同错误预测上的一致性是否表明存在共享的失败模式,例如选项偏差?
  • RQ5问题难度或文化特异性的定性差异在多大程度上影响模型的泛化能力?

主要发现

  • 在分布外基准上评估时,微调模型表现出显著的性能下降,平均准确率从超过80%降至某些情况下低于60%。
  • 性能损失在多个基准上均显著且一致,表明尽管域内准确率高,但泛化能力仍较差。
  • 在多个案例中,所有域外模型在域内模型正确回答的问题上均给出相同的错误答案,表明存在共享的失败模式。
  • 一致性分析显示,某些问题会触发模型产生相同的错误预测,提示答案选择中可能存在选项偏差。
  • 定性分析表明,模型有时会在看似显而易见的问题上失败,表明失败原因并非仅由难度导致。
  • 结果表明,当前基准可能包含干扰因素,如语法线索或文化特异性,从而扭曲对真正常识推理能力的评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。