[论文解读] Semi Supervised Preposition-Sense Disambiguation using Multilingual Data
本文提出了一种半监督方法用于介词义项消歧(PSD),通过利用多语言平行数据对基于LSTM的上下文编码器进行预训练。该模型从英语上下文中预测外语介词,从而捕捉蕴含义项信息的表征,并在小规模有监督PSD数据集上进行微调,最终在Web-reviews语料库上达到80.54的SOTA准确率,在SemEval语料库上达到81.7的SOTA准确率,且未使用外部词典资源。
Prepositions are very common and very ambiguous, and understanding their sense is critical for understanding the meaning of the sentence. Supervised corpora for the preposition-sense disambiguation task are small, suggesting a semi-supervised approach to the task. We show that signals from unannotated multilingual data can be used to improve supervised preposition-sense disambiguation. Our approach pre-trains an LSTM encoder for predicting the translation of a preposition, and then incorporates the pre-trained encoder as a component in a supervised classification system, and fine-tunes it for the task. The multilingual signals consistently improve results on two preposition-sense datasets.
研究动机与目标
- 解决介词义项消歧(PSD)任务中监督训练数据稀缺的问题,该任务虽关键但资源匮乏。
- 通过利用大规模多语言平行语料库作为弱监督来源,克服对人工构建词典(如WordNet)的依赖。
- 通过从多语言上下文表征迁移学习,提升单语PSD性能。
- 证明多语言信号在学习歧义介词的上下文敏感表征方面的有效性。
- 在不使用外部词汇资源的情况下,实现在两个主要PSD基准上的SOTA结果。
提出的方法
- 在大规模单语-多语言平行语料库上预训练LSTM编码器,以预测上下文中英语介词的翻译。
- 将预训练的LSTM作为上下文编码器,为目标介词生成具有义项区分能力的表征。
- 在小规模有监督PSD数据集上端到端微调整个模型,使用交叉熵损失进行分类。
- 通过多任务学习整合多语言信号,其中辅助任务为介词翻译预测。
- 利用多语言与单语任务之间的共享表征,提升泛化能力和义项区分能力。
- 在Web-reviews语料库上使用12个粗粒度超义项的统一义项体系,在原始SemEval 2007义项集合上进行评估。
实验结果
研究问题
- RQ1多语言平行数据能否作为介词义项消歧的有效弱监督来源?
- RQ2在翻译预测上进行预训练是否能提升PSD上下文表征的质量?
- RQ3利用多语言信号的半监督方法能否超越仅依赖有限标注数据的有监督模型?
- RQ4多语言信号带来的性能提升是否在不同介词义项数据集和义项体系中保持一致?
- RQ5该方法能否在不使用人工构建的词汇资源(如WordNet)的情况下实现SOTA性能?
主要发现
- 所提方法在Web-reviews语料库上达到80.54的测试准确率,显著优于先前的有监督模型。
- 在SemEval 2007语料库上,模型达到81.7%的准确率,优于大多数先前方法,且未使用WordNet或其他词典。
- 多语言预训练在两个数据集上均持续提升性能,证明了翻译预测信号的稳健性。
- 模型表明,通过多语言翻译预测学习到的上下文表征对介词义项具有高度预测能力。
- 性能提升归因于模型通过大规模平行数据学习到具有义项区分能力的表征,即使没有显式的义项标注。
- 结果验证了多任务学习与迁移学习在低资源NLP场景下的有效性,尤其适用于语义消歧任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。