[论文解读] Cross-Lingual Semantic Role Labeling with High-Quality Translated Training Corpus
本文提出一种基于翻译的跨语言语义角色标注(SRL)方法,通过将英语标准SRL标注句翻译为目标语言,生成高质量的伪标注训练数据,用于低资源语言。该方法在Universal Proposition Bank中的七种语言上显著提升了SRL性能,当使用PGN-BiLSTM模型结合源语言和翻译数据时,性能进一步提升。
Many efforts of research are devoted to semantic role labeling (SRL) which is crucial for natural language understanding. Supervised approaches have achieved impressing performances when large-scale corpora are available for resource-rich languages such as English. While for the low-resource languages with no annotated SRL dataset, it is still challenging to obtain competitive performances. Cross-lingual SRL is one promising way to address the problem, which has achieved great advances with the help of model transferring and annotation projection. In this paper, we propose a novel alternative based on corpus translation, constructing high-quality training datasets for the target languages from the source gold-standard SRL annotations. Experimental results on Universal Proposition Bank show that the translation-based method is highly effective, and the automatic pseudo datasets can improve the target-language SRL performances significantly.
研究动机与目标
- 通过利用高质量、自动生成的训练数据,解决非英语语言中低资源语义角色标注(SRL)的挑战。
- 探索语料翻译作为注释投影或模型迁移在跨语言SRL中的有效性替代方案。
- 通过结合标准源语言数据与翻译的目标语言数据,提升多语言SRL性能。
- 研究在混合多语言语料中,使用参数生成网络(PGN)与BiLSTM联合建模语言特异性差异的优势。
- 在涵盖多种语言家族的多种语言中,评估单源与多源迁移设置的表现。
提出的方法
- 使用先进的神经机器翻译(NMT)将高资源源语言(如英语)的黄金标准SRL标注句翻译成目标语言。
- 通过词对齐将源语言侧的原始SRL标签映射到翻译后的目标语言句中,生成伪标注的目标语言数据集。
- 将原始源语言SRL语料与翻译后的目标语言伪语料结合,形成混合多语言训练集。
- 使用多语言上下文词表示(如mBERT)作为模型的输入特征。
- 采用参数生成网络(PGN)适配BiLSTM编码器以适应不同语言,从而更好地建模语言特异性模式。
- 在结合的源语言与翻译的目标语言数据上联合训练SRL模型,其中PGN动态生成每种语言的模型参数。
实验结果
研究问题
- RQ1将高资源语言的黄金标准SRL标注句翻译成低资源语言,能否生成高质量、可使用的跨语言SRL训练数据?
- RQ2与传统的注释投影或模型迁移相比,基于翻译的方法在跨语言SRL中的性能表现如何?
- RQ3结合标准源语言数据与翻译的目标语言数据,是否能在多种语言上提升SRL性能?
- RQ4PGN-BiLSTM架构在多语言设置中,能在多大程度上增强模型在不同语言间泛化的能力?
- RQ5在多源迁移设置中,性能趋势如何随源语言多样性的增加而变化,且在不同语言家族中的表现有何差异?
主要发现
- 该翻译方法在Universal Proposition Bank(UPB v1.0)的全部七种目标语言上显著提升了SRL性能,优于基线方法。
- 多源迁移设置(即以其他所有语言作为每个目标语言的源语言)在所有语言上均取得最佳性能,表明训练数据中语言多样性的优势。
- 使用PGN-BiLSTM模型相比标准BiLSTM CRF模型实现了持续改进,尤其在捕捉语言特异性句法与语义模式方面表现更优。
- SRL性能随论元与谓词间表面距离的增加而下降,但所提方法在长距离情况下仍保持强劲性能。
- 论元角色的F1分数呈现频率相关趋势:A0(施事)得分最高,A1(受事)次之,而A2和AM-TMP等较少见角色的得分虽较低,但经本方法改进后仍显著提升。
- PGN模型中语言ID嵌入的欧氏距离与性能趋势相关,表明语言对越接近,跨语言迁移的收益越大。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。