[论文解读] Linguistic Analysis of Pretrained Sentence Encoders with Acceptability Judgments
本文通过在 CoLA 开发集的 1,043 个句子上标注 13 种句法现象,引入了一个细粒度的、语言学标注的预训练句子编码器评估集。利用该数据集,作者对 BERT、GPT 和一个 BiLSTM 基线模型进行了探针分析,发现尽管所有模型都能很好地处理复杂的论元结构,但长距离依存关系(如疑问句)仍具挑战性——尤其对 BiLSTM 而言,其表现显著落后于 BERT 和 GPT。
Recent work on evaluating grammatical knowledge in pretrained sentence encoders gives a fine-grained view of a small number of phenomena. We introduce a new analysis dataset that also has broad coverage of linguistic phenomena. We annotate the development set of the Corpus of Linguistic Acceptability (CoLA; Warstadt et al., 2018) for the presence of 13 classes of syntactic phenomena including various forms of argument alternations, movement, and modification. We use this analysis set to investigate the grammatical knowledge of three pretrained encoders: BERT (Devlin et al., 2018), GPT (Radford et al., 2018), and the BiLSTM baseline from Warstadt et al. We find that these models have a strong command of complex or non-canonical argument structures like ditransitives (Sue gave Dan a book) and passives (The book was read). Sentences with long distance dependencies like questions (What do you think I ate?) challenge all models, but for these, BERT and GPT have a distinct advantage over the baseline. We conclude that recent sentence encoders, despite showing near-human performance on acceptability classification overall, still fail to make fine-grained grammaticality distinctions for many complex syntactic structures.
研究动机与目标
- 通过创建一个将可接受性判断与特定句法现象关联的数据集,解决预训练句子编码器缺乏细粒度、领域通用语言学评估的问题。
- 研究 BERT、GPT 和一个 BiLSTM 基线模型在理解多样的句法结构(包括论元交替、句法移位和修饰结构)方面的能力。
- 识别当前模型面临的最大挑战,特别是在长距离依存关系和非标准结构方面。
- 提供一个具有语言学可解释性的基准,使模型性能与理论语言学概念之间能够进行直接比较。
提出的方法
- 使用主流出版物中的专家语言学知识,将 CoLA 开发集标注为 13 种句法现象类别,每种类别定义为更具体构式的并集。
- 将标注后的数据集用作探针任务:在预训练句子编码器(BERT、GPT、BiLSTM)之上训练一个小型分类器,以预测句子的可接受性。
- 评估模型在特定句法类别上的表现,通过比较不同现象的准确率来识别其相对优势与劣势。
- 重点关注被动语态、强调句、疑问句、省略和状语等现象,以评估模型对句法复杂性和结构距离的敏感度。
- 使用原始 CoLA 数据集作为可接受性判断的来源,同时通过添加详细的句法标注,实现细粒度分析。
- 应用标准探针方法,将语法知识与通用表征学习分离,将可接受性预测视为诊断性任务。
实验结果
研究问题
- RQ1预训练句子编码器(如 BERT 和 GPT)在哪些句法现象上最具挑战性?与 BiLSTM 基线相比表现如何?
- RQ2BERT 和 GPT 在涉及长距离依存关系(如疑问句和强调句)的现象中,与 BiLSTM 相比在多大程度上展现出更优的语法知识?
- RQ3非标准论元结构(如被动语态和双及物动词)如何影响模型性能?它们是否构成显著挑战?
- RQ4是否存在 BERT 和 GPT 与 BiLSTM 表现无明显差异的特定句法结构?这对其语言泛化能力意味着什么?
- RQ5这些模型在区分语法可接受性与细微句法违规(如一致关系错误或词序错误)方面表现如何?
主要发现
- BERT 和 GPT 在句法移位现象(如强调句 'It is Bo that left')和具有长距离依存关系的疑问句(如 'What do you think I ate?')上,显著优于 BiLSTM。
- BiLSTM 模型在长距离依存关系上表现最差,而 BERT 和 GPT 保持了强劲的性能,表明其注意力机制更能有效处理结构复杂性。
- 非标准论元结构(如被动语态 'The book was read' 和双及物结构 'Sue gave Dan a book')被所有模型良好理解,表明其对论元交替模式的学习具有鲁棒性。
- 带有状语的结构(如 'Sue exercises in the morning')在各模型间无显著性能差异,表明这些结构对任何编码器而言均不具特别挑战性。
- 省略和回指结构(如 'I saw Bill while you did so Mary')对所有模型都具挑战性,但 BERT 和 GPT 在这些结构上仍表现出适度优势。
- 研究发现,尽管模型在整体可接受性分类上接近人类水平,但在复杂句法结构(尤其是涉及长距离依存关系的结构)上的细粒度语法正确性区分上仍存在不足。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。