Skip to main content
QUICK REVIEW

[论文解读] Verb Argument Structure Alternations in Word and Sentence Embeddings

Katharina Kann, Alex Warstadt|arXiv (Cornell University)|Nov 27, 2018
Natural Language Processing Techniques参考文献 35被引用 13
一句话总结

本文研究了人工神经网络中的词向量和句子嵌入是否编码了动词论元结构交替的细粒度信息——即动词可出现的句法框架。利用两个新数据集 FAVA(句级)和 LaVA(词级),作者训练分类器基于嵌入预测语法可接受性,发现模型能可靠检测某些交替形式(如使役-不及物交替),但对其他形式(如 spray-load)则表现不佳,表明嵌入中对句法知识的编码不完整或难以提取。

ABSTRACT

Verbs occur in different syntactic environments, or frames. We investigate whether artificial neural networks encode grammatical distinctions necessary for inferring the idiosyncratic frame-selectional properties of verbs. We introduce five datasets, collectively called FAVA, containing in aggregate nearly 10k sentences labeled for grammatical acceptability, illustrating different verbal argument structure alternations. We then test whether models can distinguish acceptable English verb-frame combinations from unacceptable ones using a sentence embedding alone. For converging evidence, we further construct LaVA, a corresponding word-level dataset, and investigate whether the same syntactic features can be extracted from word embeddings. Our models perform reliable classifications for some verbal alternations but not others, suggesting that while these representations do encode fine-grained lexical information, it is incomplete or can be hard to extract. Further, differences between the word- and sentence-level models show that some information present in word embeddings is not passed on to the down-stream sentence embeddings.

研究动机与目标

  • 评估人工神经网络嵌入是否编码了动词框架选择性属性所必需的语法差异。
  • 探究词嵌入是否能预测某个动词可参与的句法框架。
  • 确定句子嵌入是否能基于句法结构对动词-框架组合的可接受性进行分类。
  • 比较词级和句级模型在捕捉动词论元结构交替方面的性能。
  • 评估词嵌入中的句法知识在下游句子嵌入中保留的程度。

提出的方法

  • 作者构建了 FAVA 数据集,包含约 10,000 个句子,标注了语法可接受性,重点关注五种动词论元结构交替(如使役-不及物、与格、spray-load、there-插入、反身代词)。
  • LaVA 数据集用于词级评估,基于 Levin (1993) 的动词类,以检验动词语嵌入是否能预测框架兼容性。
  • 在句子嵌入上训练二元可接受性分类器,以区分语法上可接受与不可接受的动词-框架组合。
  • 在词嵌入上训练多类分类器,以预测某个动词可允许的句法框架。
  • 通过 FAVA 和 LaVA 数据集的黄金标准标注对模型进行评估,以衡量分类性能。
  • 通过比较不同交替类型的表现,识别出嵌入中更易编码的句法结构模式。

实验结果

研究问题

  • RQ1仅凭词嵌入能否基于其词汇属性预测某个动词可参与的句法框架?
  • RQ2当主要动词在不同框架间存在歧义时,句子嵌入是否仍能编码动词-框架组合的语法可接受性?
  • RQ3哪些动词论元结构交替能被神经网络嵌入更可靠地检测到,原因是什么?
  • RQ4词嵌入中的句法信息在下游句子嵌入中保留的程度如何?
  • RQ5句法复杂度的差异(如论元数量)如何影响模型学习动词框架交替的能力?

主要发现

  • 模型在分类某些动词交替的可接受性方面表现可靠,例如使役-不及物交替和 there-插入,这些交替涉及不及物框架。
  • spray-load 交替尽管占数据集的一半以上,却是模型最难学习的,表明高频率数据并不能保证高性能。
  • 不同交替类型之间的表现差异显著,不及物框架比涉及双及物或介词短语的多论元框架更容易检测。
  • 对于某些交替,词级模型的性能优于句级模型,表明词嵌入中的一些句法信息未被完全传递到句子嵌入中。
  • 训练样本数量与模型性能之间没有明显相关性,表明数据量本身并不能决定动词框架交替学习的成功与否。
  • 结果表明,尽管神经网络嵌入编码了部分细粒度句法知识,但其编码不完整,且在所有动词交替中并非均匀可访问。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。