[论文解读] Accurate, yet inconsistent? Consistency Analysis on Language Understanding Models
本文提出了 CALUM,一种通过应用语义保持的扰动(如反转和同义词替换)来评估微调后的预训练语言模型(PLMs)一致性的框架。实验表明,当前的 PLMs 经常对语义相同的输入产生不一致的预测,但通过引入释义识别任务进行多任务训练,可使一致性平均提升 13%。
Consistency, which refers to the capability of generating the same predictions for semantically similar contexts, is a highly desirable property for a sound language understanding model. Although recent pretrained language models (PLMs) deliver outstanding performance in various downstream tasks, they should exhibit consistent behaviour provided the models truly understand language. In this paper, we propose a simple framework named consistency analysis on language understanding models (CALUM)} to evaluate the model's lower-bound consistency ability. Through experiments, we confirmed that current PLMs are prone to generate inconsistent predictions even for semantically identical inputs. We also observed that multi-task training with paraphrase identification tasks is of benefit to improve consistency, increasing the consistency by 13% on average.
研究动机与目标
- 调查微调后的预训练语言模型(PLMs)在面对语义相同的输入时是否表现出一致的行为。
- 评估 PLMs 在多样化语言理解任务和语言中的一致性能力下限。
- 探索是否通过语义文本相似性(STS)任务的多任务训练可提升模型的一致性。
- 开发一种可泛化的评估框架,该框架不依赖于任务特定的数据增强或人工标注的扰动。
提出的方法
- 提出 CALUM 框架,通过应用微小扰动(如反转句子顺序或替换同义词)来保持语义含义。
- 使用反转(REVERSE)和基于同义词的(SIGNAL)扰动,生成语义等价的输入对以评估一致性。
- 采用多任务学习设置,使用 MT-DNN 架构,共享编码器但具有任务特定的分类器。
- 在主 NLP 任务(如 MNLI、QNLI、RTE)上训练模型,同时引入辅助 STS 任务(QQP、MRPC),以评估其对一致性的影响。
- 将一致性度量为在扰动输入对中预测结果保持不变的比例。
- 在多个主干模型(RoBERTa、Electra、GPT2)上,对比单任务模型与多任务模型(Multitask-Para 和 Multitask-All)在一致性与准确率上的表现。
实验结果
研究问题
- RQ1微调后的 PLMs 在面对语义相同的输入时,其预测不一致的程度有多大?
- RQ2通过语义文本相似性(STS)任务的多任务训练能否提升 PLMs 的一致性?
- RQ3与包含其他非 STS 任务相比,将 STS 任务作为辅助目标在提升一致性方面表现如何?
- RQ4基于 STS 的多任务学习的优势是否在不同模型架构(如编码器与解码器架构)和下游任务中具有泛化性?
主要发现
- 当前的 PLMs 展现出显著的不一致性,即使在不同任务和语言中,对语义相同的输入也会生成不同的预测。
- 通过 STS 任务(QQP 和 MRPC)进行多任务训练,可在所有评估任务和模型上平均使一致性提升 13%。
- Multitask-Para 模型(仅使用 STS 任务)在一致性方面始终优于单任务基线模型,尤其在 REVERSE 情况下表现更优,表明仅 STS 数据即可实现一致性提升。
- 对于编码器架构模型(RoBERTa、Electra),Multitask-All 模型(包含全部五个任务)的一致性高于 Multitask-Para,尽管差异并不总是显著。
- 对于解码器架构模型(GPT2),在 REVERSE 情况下,Multitask-Para 模型的一致性高于 Multitask-All 模型,表明不同架构在利用辅助任务方面存在差异。
- 一致性提升并未伴随准确率的显著下降,表明一致性增益并未以牺牲主任务性能为代价。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。