Skip to main content
QUICK REVIEW

[论文解读] Model Transfer for Tagging Low-resource Languages using a Bilingual Dictionary

Meng Fang, Trevor Cohn|arXiv (Cornell University)|May 1, 2017
Topic Modeling参考文献 12被引用 6
一句话总结

本文提出了一种低资源词性标注框架,利用双语词典生成跨语言词嵌入以实现远程监督,通过多任务学习将这些嵌入与少量黄金标注数据相结合。该方法通过非线性变换和基于词类不确定性的主动学习,将标注需求减少一个数量级,同时在无需平行语料库的情况下,在低资源语言上实现了最先进性能。

ABSTRACT

Cross-lingual model transfer is a compelling and popular method for predicting annotations in a low-resource language, whereby parallel corpora provide a bridge to a high-resource language and its associated annotated corpora. However, parallel data is not readily available for many languages, limiting the applicability of these approaches. We address these drawbacks in our framework which takes advantage of cross-lingual word embeddings trained solely on a high coverage bilingual dictionary. We propose a novel neural network model for joint training from both sources of data based on cross-lingual word embeddings, and show substantial empirical improvements over baseline techniques. We also propose several active learning heuristics, which result in improvements over competitive benchmark methods.

研究动机与目标

  • 通过用双语词典替代平行语料库,解决低资源语言词性标注中缺乏平行语料的问题。
  • 通过在跨语言嵌入的远程监督和少量黄金标注数据上联合训练,提升低资源设置下的模型性能。
  • 通过设计适用于低资源、低监督环境的有效主动学习启发式方法,降低标注成本。
  • 证明对远程标签进行非线性变换在跨语言迁移中比线性方法更有效。
  • 证明基于不确定性和频率偏差的词类级别主动学习显著优于基于词元或句子级别的采样方法。

提出的方法

  • 使用双语词典和单语语料库,通过CCA或基于聚类的方法训练跨语言词嵌入。
  • 采用BiLSTM-CRF架构的联合多任务学习模型,将来自跨语言嵌入的远程监督与黄金标注数据相结合。
  • 多层感知机对远程标签执行非线性变换,以更好地与黄金标签对齐,捕捉语言特异性和错误校正模式。
  • 主动学习启发式方法包括基于词类的不确定性采样,并引入频率偏差以优先选择信息量大且稀有的词。
  • 模型使用早停法和带动量的随机梯度下降训练,基于DyNet实现,评估在多种低资源语言上的性能。
  • 通过嵌入的跨语言词对齐应用远程监督,避免依赖平行句子对。

实验结果

研究问题

  • RQ1仅靠双语词典是否足以提供有效的跨语言监督,以实现低资源语言的词性标注?
  • RQ2在远程监督和少量黄金标注数据上联合训练是否比单独使用任一来源更能提升标注准确率?
  • RQ3在跨语言迁移的词性标注中,对远程标签进行非线性变换是否优于线性方法?
  • RQ4基于词类不确定性与频率偏差的主动学习策略是否比基于词元或句子级别的采样更有效地降低标注成本?
  • RQ5跨语言嵌入的质量(如CCA与聚类方法)在低资源设置下如何影响性能?

主要发现

  • 联合模型通过多任务学习在所有测试的低资源语言上均显著优于基线模型,包括BiLSTM和BiLSTM-CRF。
  • 仅使用远程监督即可达到合理准确率,但与黄金数据联合训练后,所有语言的性能均有显著提升。
  • 所提方法将所需标注数据减少了一个数量级——仅用100个标注词即可达到与使用1,000个词相同的性能。
  • 基于词类不确定性与频率偏差的主动学习(SumType (Joint))优于所有其他启发式方法,包括传统的词元和句子级别采样。
  • 联合模型中的非线性变换显著优于BiLSTM-Debias中使用的线性变换,表明其在错误建模方面更优。
  • 欧洲语言的性能高于突厥语系语言,可能由于与英语的语言相似性更高以及词典质量更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。