Skip to main content
QUICK REVIEW

[论文解读] When Choosing Plausible Alternatives, Clever Hans can be Clever

Pride Kavumba, Naoya Inoue|arXiv (Cornell University)|Nov 1, 2019
Topic Modeling参考文献 23被引用 5
一句话总结

本文识别出COPA常识推理基准中存在于标记层面的表面性提示,这些提示使BERT在无需真正理解的情况下也能取得高准确率。通过引入Balanced COPA——一个中和这些提示的COPA镜像版本——本文表明,当提示被消除后,BERT在困难样本上仍表现良好,表明其具备任务学习能力;而RoBERTa即使在提示存在时也完全不依赖这些提示,表明其泛化能力更强。

ABSTRACT

Pretrained language models, such as BERT and RoBERTa, have shown large improvements in the commonsense reasoning benchmark COPA. However, recent work found that many improvements in benchmarks of natural language understanding are not due to models learning the task, but due to their increasing ability to exploit superficial cues, such as tokens that occur more often in the correct answer than the wrong one. Are BERT's and RoBERTa's good performance on COPA also caused by this? We find superficial cues in COPA, as well as evidence that BERT exploits these cues. To remedy this problem, we introduce Balanced COPA, an extension of COPA that does not suffer from easy-to-exploit single token cues. We analyze BERT's and RoBERTa's performance on original and Balanced COPA, finding that BERT relies on superficial cues when they are present, but still achieves comparable performance once they are made ineffective, suggesting that BERT learns the task to a certain degree when forced to. In contrast, RoBERTa does not appear to rely on superficial cues.

研究动机与目标

  • 探究BERT在COPA上表现优异是否源于利用表面性提示而非真正的常识推理。
  • 分析COPA数据集中独立于上下文即可预测正确答案的标记级别提示的存在与影响。
  • 开发一种改进的基准——Balanced COPA,通过镜像实例使正确与错误选项之间的标记分布均衡,从而消除此类提示。
  • 评估BERT和RoBERTa等模型在表面提示被移除后是否仍能学习底层任务。
  • 比较模型在原始COPA与Balanced COPA上的行为,以评估其对启发式方法与真正推理的依赖程度。

提出的方法

  • 通过仅提供两个选项(不提供前提)对微调后的BERT进行数据集消融实验,发现由于标记分布不平衡,模型仍能取得高于随机水平的准确率。
  • 识别出特定单个标记(如'woman'、'mother')在正确答案中出现频率更高,构成表面性提示。
  • 通过创建镜像实例构建Balanced COPA:对于每个原始COPA样本,生成一个新前提,使原错误选项变为正确,确保每个选项作为正确答案和错误答案的出现频率相等。
  • 在原始COPA和Balanced COPA上分别微调BERT和RoBERTa,并比较其在易例(提示丰富)与难例(无提示)上的表现。
  • 使用基于梯度的显著性分析测量模型对单个标记的敏感度,比较在原始数据与平衡数据上微调的模型表现。
  • 量化提示的生产力,并分析在Balanced COPA上微调后提示敏感度的变化,以评估模型对提示的利用程度。

实验结果

研究问题

  • RQ1COPA中的表面性标记级别提示是否使BERT等模型在不理解底层因果推理任务的情况下仍能取得高准确率?
  • RQ2BERT在多大程度上依赖这些提示?当提示被中和后,它是否仍能表现良好?
  • RQ3当COPA中存在表面性提示时,RoBERTa是否表现出类似的依赖性?
  • RQ4当表面提示被移除后(如在Balanced COPA中),模型是否仍能学习真正的推理任务?
  • RQ5为什么RoBERTa在难例上表现优于BERT,且即使提示存在也完全不敏感?

主要发现

  • BERT在含表面提示的易例上准确率达83.9%,但在无提示的难例上仅达71.9%,表明其对提示存在强烈依赖。
  • 在Balanced COPA上微调后,BERT的整体性能与原始COPA相当,表明其在提示被中和后仍能学习任务。
  • 梯度分析显示,经Balanced COPA微调的BERT对高生产力表面提示(如'woman'、'mother')的敏感度显著低于在原始COPA上微调的BERT。
  • RoBERTa即使在原始COPA中提示存在时,也未表现出对表面提示的明显敏感度,表明其未利用这些提示。
  • RoBERTa在Balanced COPA上的表现优于在原始COPA上,表明移除提示可提升其性能,可能是因为减少了对虚假模式的依赖。
  • 结果表明,尽管BERT利用COPA中的表面提示,但当被迫时仍能学习底层推理任务;而RoBERTa似乎从一开始就更稳健地学习了该任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。