Skip to main content
QUICK REVIEW

[论文解读] MTLB-STRUCT @PARSEME 2020: Capturing Unseen Multiword Expressions Using Multi-task Learning and Pre-trained Masked Language Models

Shiva Taslimipoor, Sara Bahaadini|arXiv (Cornell University)|Nov 4, 2020
Topic Modeling参考文献 22被引用 15
一句话总结

该论文提出 MTLB-STRUCT,一种多任务学习系统,通过多语言 BERT 联合预测动词性多词表达(VMWEs)和依存句法树。通过共享 BERT 的隐藏表示并使用树条件随机场(tree CRF)进行句法分析,该模型在 14 种语言上对未见 VMWE 的 F1 分数达到当前最优水平,在 PARSEME 2020 共享任务中排名第一。

ABSTRACT

This paper describes a semi-supervised system that jointly learns verbal multiword expressions (VMWEs) and dependency parse trees as an auxiliary task. The model benefits from pre-trained multilingual BERT. BERT hidden layers are shared among the two tasks and we introduce an additional linear layer to retrieve VMWE tags. The dependency parse tree prediction is modelled by a linear layer and a bilinear one plus a tree CRF on top of BERT. The system has participated in the open track of the PARSEME shared task 2020 and ranked first in terms of F1-score in identifying unseen VMWEs as well as VMWEs in general, averaged across all 14 languages.

研究动机与目标

  • 解决在多种语言的低资源和零样本设置下检测未见多词表达(MWEs)的挑战。
  • 通过利用预训练语言模型和半监督多任务学习,提升 MWE 检测的泛化能力。
  • 联合学习 VMWE 标注与依存句法分析,以增强句法和语义表征学习。
  • 开发一种跨语言系统,在无需语言特定特征或数据整理的情况下表现稳健。
  • 在已见和未见 MWE 上评估性能,尤其关注未登录词率高的低资源场景。

提出的方法

  • 微调多语言 BERT 作为 VMWE 检测和依存句法分析的共享上下文编码器。
  • 在 BERT 最终隐藏状态之上使用线性层,通过词元分类预测 VMWE 标签。
  • 使用双线性层和树 CRF 建模依存句法树,确保结构一致性。
  • 在两个任务之间共享 BERT 的隐藏表示,实现参数效率和跨任务知识迁移。
  • 使用联合目标函数(结合 VMWE 标注损失和依存句法分析损失)端到端训练模型。
  • 在 14 种语言上统一应用该系统,无需语言特定修改或数据增强。

实验结果

研究问题

  • RQ1联合学习 VMWE 检测与依存句法分析是否能提升对未见 MWE 的零样本和少样本泛化能力?
  • RQ2使用 BERT 的多任务学习在捕捉多种语言中 MWE 的句法与语义特异性方面有多高效?
  • RQ3与标准 CRF 或线性解码相比,引入树 CRF 是否能提升句法分析质量,并进而提升 MWE 检测性能?
  • RQ4预训练 BERT 表示在多大程度上缓解数据稀缺问题,并提升高未见 MWE 比率的低资源语言的性能?
  • RQ5该系统在不同 MWE 类型(包括非连续和轻动词结构)上的表现如何,尤其在低资源设置下?

主要发现

  • 该系统在 PARSEME 2020 共享任务中 14 种语言的全局基于 MWE 的 F1 得分为 70.14,为最高分。
  • 其未见 MWE 基于 F1 得分为 38.53,位居开放赛道第一。
  • 在葡萄牙语(PT)上,该系统在未见 MWE 上的 F1 比第二名系统(Seen2Unseen)高出 21.59 分。
  • 在印地语(HI)上,该系统与 Seen2Unseen 的差距达 10.45 F1 分,表明在未见率高的语言中具有强大泛化能力。
  • 该系统在未见 MWE 比例较高的语言(如 GA、HE、HI)上表现最佳,表明其具备强大的零样本泛化能力。
  • 在印地语(7%)和土耳其语(4%)的非连续 MWE 上性能显著下降(最高达 30 F1 分),表明其在处理结构复杂性方面仍面临挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。