[论文解读] Causal Transformers Perform Below Chance on Recursive Nested Constructions, Unlike Humans
本研究评估了当前最先进的Transformer语言模型在处理递归嵌套句法结构方面是否与人类同样有效。尽管在短距离嵌套依存关系上表现近乎完美,但Transformer在长距离嵌套依存关系上的表现却低于随机水平——当在句中加入一个三词介词短语时,性能急剧下降,揭示了其在递归、结构敏感处理方面存在关键性的脆弱性,这与早期RNN-LM研究中的发现相似。
Recursive processing is considered a hallmark of human linguistic abilities. A recent study evaluated recursive processing in recurrent neural language models (RNN-LMs) and showed that such models perform below chance level on embedded dependencies within nested constructions -- a prototypical example of recursion in natural language. Here, we study if state-of-the-art Transformer LMs do any better. We test four different Transformer LMs on two different types of nested constructions, which differ in whether the embedded (inner) dependency is short or long range. We find that Transformers achieve near-perfect performance on short-range embedded dependencies, significantly better than previous results reported for RNN-LMs and humans. However, on long-range embedded dependencies, Transformers' performance sharply drops below chance level. Remarkably, the addition of only three words to the embedded dependency caused Transformers to fall from near-perfect to below-chance performance. Taken together, our results reveal Transformers' shortcoming when it comes to recursive, structure-based, processing.
研究动机与目标
- 调查当前最先进的Transformer语言模型在处理递归嵌套句法结构方面是否优于RNN-LM。
- 比较模型在数-一致任务中处理短距离与长距离嵌套依存关系的表现差异。
- 检验Transformer在递归结构处理中是否表现出与RNN-LM相似的处理脆弱性。
- 探索模型的错误模式是否与人类语言偏见(如标记度效应)一致或偏离。
- 评估在嵌套依存关系中引入最小句法复杂性(如添加一个三词介词短语)是否会导致模型性能急剧下降。
提出的方法
- 在两种句法任务(Short-Nested与Long-Nested结构)上评估了四个预训练的Transformer语言模型(GPT2-XL、GPT2-Large、GPT2-Medium、GPT2)的表现。
- 设计了包含嵌套依存关系的句子对,要求主名词与动词之间在数上保持一致,条件中交替使用单数/复数形式。
- 通过模型在主(外层)和嵌套(内层)依存关系上的一致性判断错误率来衡量其性能。
- 比较不同模型和任务中的表现,重点关注不一致条件(如单数主语搭配复数动词),以评估偏差与泛化能力。
- 分析当在嵌套依存关系中加入一个三词介词短语(如“near the cabinet”)后,性能的变化,以实现最小句法修改。
- 使用先前研究中的人类表现基准来定位模型行为,特别是与标记度效应的关系。
实验结果
研究问题
- RQ1Transformer语言模型在处理递归嵌套句法结构方面是否优于RNN-LM?
- RQ2在递归结构中,模型在短距离与长距离嵌套依存关系上的表现有何差异?
- RQ3当在嵌套依存关系中引入最小句法修改(如添加一个介词短语)时,模型性能会发生什么变化?
- RQ4Transformer是否在递归处理中表现出与RNN-LM相同的错误模式,特别是嵌套依存关系上的低于随机水平表现?
- RQ5模型的错误模式在多大程度上反映或偏离了人类语言偏见(如标记度效应)?
主要发现
- 在短距离嵌套依存关系上,Transformer的错误率接近于零,表现近乎完美。
- 在长距离嵌套依存关系上,Transformer的错误率低于随机水平,尤其在PSP条件(复数主语搭配单数动词)下表现系统性失败。
- 仅在嵌套依存关系中添加三个词(如“near the cabinet”)就导致性能从近乎完美骤降至低于随机水平。
- 所有模型(包括Transformer和LSTM)均表现出一致的偏差:当主语为单数时错误更多,反映出标记度效应。
- 主(更长)依存关系的表现仍高于随机水平,表明长度本身的影响小于递归嵌套的影响。
- 尽管在许多NLP任务中表现优异,Transformer在处理递归、结构敏感的依存关系时仍表现出关键性的脆弱性,与RNN-LM的缺陷相似。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。