[论文解读] Shallow Syntax in Deep Water
本文研究在上下文词表示中引入浅层句法结构(如短语块)是否能提升自然语言处理任务的性能。提出两种方法:在预测的浅层句法解析上预训练ELMo,以及在下游模型中加入块特征。尽管块识别准确率高达97% F1,但两种方法均未在ELMo-only基线之上带来显著性能提升,探针分析也证实ELMo的表示已编码句法知识,因此显式引入浅层句法信息对下游任务无益。
Shallow syntax provides an approximation of phrase-syntactic structure of sentences; it can be produced with high accuracy, and is computationally cheap to obtain. We investigate the role of shallow syntax-aware representations for NLP tasks using two techniques. First, we enhance the ELMo architecture to allow pretraining on predicted shallow syntactic parses, instead of just raw text, so that contextual embeddings make use of shallow syntactic context. Our second method involves shallow syntactic features obtained automatically on downstream task data. Neither approach leads to a significant gain on any of the four downstream tasks we considered relative to ELMo-only baselines. Further analysis using black-box probes confirms that our shallow-syntax-aware contextual embeddings do not transfer to linguistic tasks any more easily than ELMo's embeddings. We take these findings as evidence that ELMo-style pretraining discovers representations which make additional awareness of shallow syntax redundant.
研究动机与目标
- 评估浅层句法结构是否能提升自然语言处理中的上下文词表示。
- 探究在预测的浅层句法解析上预训练是否能增强ELMo风格的表示。
- 评估在具有上下文词表示的下游模型中加入自动块特征的影响。
- 确定浅层句法感知表示是否比标准ELMo表示在语言探针任务中具有更好的迁移能力。
- 比较将句法监督整合到预训练中的不同训练方案。
提出的方法
- 通过联合预训练目标增强ELMo,该目标同时依赖于前序词及其预测的浅层句法块。
- 在CoNLL 2000和Penn Treebank上训练BiLSTM-CRF模型,生成高准确率(97% F1)的浅层句法标注。
- 将预测的块特征整合到下游模型(如双注意力分类网络)中,用于情感分析和命名实体识别。
- 采用分阶段训练方法:先预训练序列编码器,然后在训练语法编码器时冻结或微调它。
- 应用Liu等人(2019)的黑箱语言探针,评估上下文嵌入中句法知识的迁移能力。
- 比较端到端训练与分阶段训练(冻结或微调语法编码器)在效率和性能上的差异。
实验结果
研究问题
- RQ1在预测的浅层句法解析上预训练ELMo是否能提升下游自然语言处理任务的性能?
- RQ2当与上下文词表示结合时,自动提取的块特征是否能提供额外优势?
- RQ3与标准ELMo表示相比,浅层句法感知的上下文嵌入是否在语言探针任务中具有更好的迁移能力?
- RQ4与端到端训练相比,句法感知预训练的分阶段训练策略在效率和准确率上是否更优?
- RQ5ELMo的预训练在多大程度上已捕捉句法知识,使得显式整合句法信息变得冗余?
主要发现
- 与ELMo-only基线相比,mSynC预训练方法或添加自动块特征在四个下游任务(NER、情感分析、依存解析、共指消解)中均未带来显著性能提升。
- 在细粒度NER任务中,使用冻结语法编码器的mSynC模型达到87.36 ± 0.02 F1,优于端到端训练(86.89 ± 0.11),并接近微调后的mSynC(87.44 ± 0.07)。
- 在语言探针任务中,mSynC在块标注任务上达到96.9 F1,证实其编码了浅层句法信息,但在其余9项探针任务中的7项上表现劣于ELMo。
- 黑箱探针显示,mSynC在句法知识迁移能力方面未显著优于ELMo,表明ELMo已有效捕捉此类信息。
- 与分阶段训练相比,端到端训练方案表现较差,表明可能需要更长训练时间,尽管计算成本过高(在2块V100上每轮需36小时)。
- 总体而言,结果表明ELMo风格的预训练已学习到使显式浅层句法感知对下游任务变得冗余的表示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。