[论文解读] Falling Through the Gaps: Neural Architectures as Models of Morphological Rule Learning
本文评估了Transformer与RNN架构作为形态规则学习模型的表现,重点关注其对产出性屈折模式的泛化能力。尽管Transformer在标准任务上表现更优,但两种模型均生成了俄语动词中母语者不会使用的第一人称单数现在时形式——表明它们未能捕捉语言中的空缺现象,提示神经语言学习模型需要引入结构先验。
Recent advances in neural architectures have revived the problem of morphological rule learning. We evaluate the Transformer as a model of morphological rule learning and compare it with Recurrent Neural Networks (RNN) on English, German, and Russian. We bring to the fore a hitherto overlooked problem, the morphological gaps, where the expected inflection of a word is missing. For example, 63 Russian verbs lack a first-person-singular present form such that one cannot comfortably say "*o\\v{s}\\v{c}u\\v{s}\\v{c}u" ("I feel"). Even English has gaps, such as the past participle of "stride": the function of morphological inflection can be partial. Both neural architectures produce inflections that ought to be missing. Analyses reveal that Transformers recapitulate the statistical distribution of inflections in the training data, similar to RNNs. Models' success on English and German is driven by the fact that rules in these languages can be identified with the majority forms, which is not universal.
研究动机与目标
- 评估Transformer架构作为最先进神经模型,是否能作为形态规则学习的更好认知模型,优于RNN。
- 探究神经架构能否学习到反映人类类比泛化的产出性形态规则,特别是在非多数形式和形态空缺的情况下。
- 检查模型是否对训练数据中的分布模式敏感,从而导致类比错误或过度泛化,即使这些形式并非母语者所用。
- 评估模型能否像人类一样隐式学会拒绝已知存在形态空缺的词的屈折形式。
- 提出将形态空缺作为评估神经语言模型认知合理性的一种诊断工具。
提出的方法
- 在英语、德语和俄语的形态屈折数据上分别训练了Transformer和RNN的序列到序列模型。
- 使用标准训练集和一个特殊测试集,其中包含63个缺少第一人称单数现在时形式的俄语动词(即形态空缺)。
- 通过预测屈折形式的似然分数来衡量模型置信度,以评估模型在空缺动词上的表现。
- 比较模型在常规动词与空缺动词上的预测表现,以检测其是否具备隐式拒绝能力。
- 分析模型在不同语言现象中的行为:英语过去时(多数规则)、德语复数(非多数产出性)和俄语空缺(结构性缺失)。
- 使用统计相关性和相似性度量比较Transformer与RNN模型的预测结果,评估其在不同条件下的行为一致性。
实验结果
研究问题
- RQ1Transformer架构能否以符合人类产出性的方式泛化形态规则,特别是在产出规则并非多数形式的情况下?
- RQ2Transformer和RNN等神经架构是否表现出与早期模型相同的类比和分布偏差,特别是在过度泛化屈折形式方面?
- RQ3当预测母语者中已知存在形态空缺的动词屈折形式时,模型是否表现出置信度下降或不确定性增加?
- RQ4两种模型在多大程度上复现了训练数据中屈折形式的统计分布,即使这些形式并非母语者所用?
- RQ5形态空缺能否作为评估神经序列模型在形态学中认知合理性的诊断基准?
主要发现
- Transformer与RNN模型均对63个俄语动词生成了母语者不会使用的第一个单数现在时屈折形式,表明它们未能尊重形态空缺。
- 模型置信度在空缺动词测试集上未显著下降:RNN置信度从0.95(σ=0.12)降至0.86(σ=0.18),Transformer从0.46(σ=0.11)降至0.39(σ=0.13),表明其对常规动词与空缺动词无明显区分。
- 两种架构的模型预测高度相关,表明其在分布泛化行为上表现相似,无论架构差异如何。
- 尽管Transformer在标准NLP任务中表现更优,但在建模人类类形态规则学习方面,其效果并不优于RNN,尤其在非多数产出性或结构性缺失的情况下。
- 模型行为表明其学习的是屈折形式的统计分布,而非潜在语言结构,因此与RNN一样导致过度泛化。
- 本研究证明,形态空缺是评估神经语言模型认知合理性的有效诊断工具,因为两种架构均未能反映母语者的约束条件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。