[论文解读] Targeted Syntactic Evaluation of Language Models
本文提出一种基于模板的语料库,用于针对语言模型的句法归纳能力进行目标化评估。通过生成仅在句法正确性上存在差异的最小对立句对(即语法正确与不正确的句子对),测试语言模型是否能为正确形式分配更高的概率。尽管采用CCG超标签的多任务训练有所改进,RNN语言模型在跨宾语关系子句的复杂句法依赖关系(如主谓一致)方面仍显著落后于人类。
We present a dataset for evaluating the grammaticality of the predictions of a language model. We automatically construct a large number of minimally different pairs of English sentences, each consisting of a grammatical and an ungrammatical sentence. The sentence pairs represent different variations of structure-sensitive phenomena: subject-verb agreement, reflexive anaphora and negative polarity items. We expect a language model to assign a higher probability to the grammatical sentence than the ungrammatical one. In an experiment using this data set, an LSTM language model performed poorly on many of the constructions. Multi-task training with a syntactic objective (CCG supertagging) improved the LSTM's accuracy, but a large gap remained between its performance and the accuracy of human participants recruited online. This suggests that there is considerable room for improvement over LSTMs in capturing syntax in a language model.
研究动机与目标
- 开发一种受控且可扩展的方法,用于评估语言模型在困惑度之外的句法泛化能力。
- 探究神经网络语言模型是否能准确区分涉及结构敏感现象的语法与不语法句子对。
- 评估使用句法监督(CCG超标签)进行多任务训练对句法性能的影响。
- 将模型性能与人类在复杂句法结构上的表现进行比较。
- 识别语言模型句法推理中的系统性错误,特别是非局部依赖关系方面的问题。
提出的方法
- 使用模板自动生成大规模、仅在句法正确性上存在差异的最小对立句对,以测试句法现象。
- 为三种句法现象构建句子对:主谓一致、反身代词回指和否定极性词(NPIs)。
- 训练n-gram基线模型、在单语语料库上训练的RNN语言模型,以及一个联合优化语言建模和CCG超标签任务的多任务RNN。
- 通过比较模型对每对中语法正确句与不正确句所分配的概率来评估模型性能。
- 使用相同刺激材料进行人工评估,以建立性能基准。
- 通过细致的错误分析识别模型偏差,如主谓一致中的吸引错误。
实验结果
研究问题
- RQ1语言模型能否在仅因句法合法性不同而构成的最小对立句对中,可靠地为语法正确的句子分配更高的概率?
- RQ2使用CCG超标签进行多任务训练在多大程度上提升了RNN语言模型的句法泛化能力?
- RQ3语言模型在非局部句法依赖关系(如宾语关系子句中的主谓一致)上失败的程度如何?
- RQ4模型在相同句法任务上的表现模式与人类表现相比如何?
- RQ5语言模型在句法决策中表现出哪些系统性偏差或启发式策略?
主要发现
- n-gram基线模型表现仅处于随机水平,表明句法泛化能力不能仅靠n-gram统计实现。
- 单任务RNN在局部主谓一致任务上表现良好,但在非局部依赖关系上表现失败,尤其在宾语关系子句中的主谓一致任务上接近随机水平。
- 多任务RNN在非局部依赖关系上的表现有所提升,但仍显著落后于人类参与者,尤其是在复杂情形下。
- 两种RNN均表现出吸引错误,倾向于选择与嵌入主语一致的动词,而非与主句主语一致的动词。
- 单任务RNN表现出对单数动词的默认偏好,这一模式与儿童语言习得中的现象一致。
- 人类参与者在复数/复数宾语关系子句任务中也出现错误,表明此类结构本身具有固有难度,但整体上仍优于模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。