Skip to main content
QUICK REVIEW

[论文解读] Transferring Semantic Roles Using Translation and Syntactic Information

Maryam Aminian, Mohammad Sadegh Rasooli|arXiv (Cornell University)|Oct 3, 2017
Natural Language Processing Techniques参考文献 10被引用 8
一句话总结

该论文提出了一种数据相关的代价敏感训练方法,通过利用句法依存对齐和词对齐密度来加权投影的标注,从而提升从资源丰富语言到资源匮乏语言的语义角色标注(SRL)迁移效果。通过将迭代自举与全数据重标注相结合,该方法在英语到德语的SRL迁移任务中,相比标准标注投影方法,F1得分绝对提升了3.5个百分点。

ABSTRACT

Our paper addresses the problem of annotation projection for semantic role labeling for resource-poor languages using supervised annotations from a resource-rich language through parallel data. We propose a transfer method that employs information from source and target syntactic dependencies as well as word alignment density to improve the quality of an iterative bootstrapping method. Our experiments yield a $3.5$ absolute labeled F-score improvement over a standard annotation projection method.

研究动机与目标

  • 通过利用平行数据,将资源丰富的语言(如英语)的标注迁移到目标语言(如德语),以应对低资源语义角色标注(SRL)的挑战。
  • 克服标准标注投影的局限性,后者易受翻译偏差、对齐错误以及多源噪声累积的影响。
  • 通过引入基于句法对应关系和投影完整性的学习型、数据相关的代价函数,取代启发式过滤方法,以提升投影质量。
  • 通过迭代自举与全数据重标注,而非仅对未标注实例进行增量标注,提升模型的鲁棒性和性能。
  • 证明基于句法和对齐信号加权投影可提升泛化能力,并在目标语言SRL上获得更高的F1得分。

提出的方法

  • 使用自动词对齐和双向对齐交集,将源语言(如英语)的SRL标注投影到目标语言(如德语)。
  • 定义投影密度度量为(投影谓词数 × 对齐词数)/(总谓词数 × 总词数),用于过滤低质量的句子对。
  • 提出一种数据相关的代价敏感训练目标,为具有强句法对应关系(源-目标依存匹配)和更高完整性的投影实例分配更高的权重。
  • 应用迭代自举方法,每个训练周期对所有训练实例(已标注和未标注)使用当前模型进行重标注,以提升一致性并过滤噪声。
  • 使用带有代价敏感目标的平均感知机分类器训练基于依存的SRL系统,以处理噪声投影数据。
  • 同时利用源语言和目标语言的句法依存关系,评估每个投影语义角色的可靠性,并据此指导代价函数。

实验结果

研究问题

  • RQ1源语言与目标语言之间的句法依存对齐是否能提升低资源SRL迁移中投影语义角色的可靠性?
  • RQ2将词对齐密度和句法对应关系整合到代价敏感训练目标中,对基于投影数据训练的SRL模型性能有何影响?
  • RQ3在噪声投影设置中,每次自举迭代中对所有数据进行重标注是否优于仅对未标注实例进行增量标注?
  • RQ4当由数据相关的代价函数引导而非人工启发式规则时,基于部分投影数据训练的模型在多大程度上能实现高性能?
  • RQ5不同语义角色(如A0与A1)对代价敏感重标注的响应有何差异?导致角色间性能差异的因素是什么?

主要发现

  • 所提方法在英语到德语的SRL迁移任务中,相比标准标注投影方法,实现了3.5个百分点的绝对F1得分提升。
  • 代价敏感重标注显著提升了VERB+A0依赖关系的精确率和召回率,精确率上升,召回率提高是由于依赖匹配检测更佳。
  • 对于VERB+A1,精确率提升但召回率略有下降,表明依赖匹配信号对这一角色效果较弱,可能由于存在稳定但匹配度低的对齐模式。
  • 将句法对应关系和对齐密度作为加权信号,可降低噪声投影的影响,并提升模型泛化能力。
  • 对所有训练实例(包括已标注数据)进行迭代重标注,相比仅添加新预测的传统自训练方法,能实现更好的收敛性和性能。
  • 该方法优于依赖外部资源(如双语词典或基于规则的过滤)的先前方法,在仅使用平行数据且无需外部语言工具的情况下实现了更高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。