Skip to main content
QUICK REVIEW

[论文解读] Acquiring Annotated Data with Cross-lingual Explicitation for Implicit Discourse Relation Classification

Wei Shi, Frances Yung|arXiv (Cornell University)|Aug 30, 2018
Natural Language Processing Techniques参考文献 28被引用 4
一句话总结

本文提出了一种跨语言显式化方法,通过利用人类翻译者在多语言翻译中插入连贯词的行为,获取用于隐性话语关系分类的高质量标注数据。通过从法语、德语和捷克语进行反向翻译,并结合多语言的多数投票机制,该方法在基线模型上显著提升了分类性能,其中双语一致性取得了最佳结果。

ABSTRACT

Implicit discourse relation classification is one of the most challenging and important tasks in discourse parsing, due to the lack of connective as strong linguistic cues. A principle bottleneck to further improvement is the shortage of training data (ca.~16k instances in the PDTB). Shi et al. (2017) proposed to acquire additional data by exploiting connectives in translation: human translators mark discourse relations which are implicit in the source language explicitly in the translation. Using back-translations of such explicitated connectives improves discourse relation parsing performance. This paper addresses the open question of whether the choice of the translation language matters, and whether multiple translations into different languages can be effectively used to improve the quality of the additional data.

研究动机与目标

  • 解决隐性话语关系分类中标注训练数据稀缺的问题,这是话语解析中的主要瓶颈。
  • 探究翻译语言的选择是否影响所获取训练数据的质量与可靠性。
  • 探索结合多个翻译语言的显式化结果是否能提升数据质量与下游分类性能。
  • 开发一种方法,利用具有文档级对齐的平行语料库中的反向翻译,识别并标注隐性话语关系。
  • 评估在多个翻译语言之间使用多数投票机制以过滤噪声或不一致显式化结果的有效性。

提出的方法

  • 利用文档对齐的平行语料库(EuroParl)识别那些在目标语言中,人类翻译者在原文为隐性的情况下插入了话语连接词的句子对。
  • 将法语、德语和捷克语的翻译句子反向翻译回英语,以恢复显式的话语标记。
  • 对反向翻译后的文本应用话语关系解析器(DRP),以识别并标注话语关系。
  • 通过在多个翻译语言之间使用多数投票机制,仅保留至少两个反向翻译在相同关系类型上达成一致的实例。
  • 筛选并保留跨语言显式化结果一致的句子对,以提高标签的可靠性。
  • 将生成的高质量、自动标注的隐性话语关系实例整合进PDTB基准的训练数据中。

实验结果

研究问题

  • RQ1翻译语言的选择是否会影响所获取隐性话语关系实例的质量与分布?
  • RQ2结合多个翻译语言的显式化结果是否能产生比单一语言更高质量的训练数据?
  • RQ3在多个反向翻译之间使用多数投票是否能降低噪声并提升标签可靠性?
  • RQ4多语言显式化方法对隐性话语关系分类模型性能有何影响?
  • RQ5该方法能否检测到同一论元对之间存在多个共现话语关系的情况?

主要发现

  • 至少两个反向翻译在相同话语关系类型上达成一致的实例,其分类性能显著优于无额外数据或仅使用单一语言数据的基线模型。
  • 该方法在PDTB基准上实现了显著的性能提升,证明了多语言显式化在数据获取方面的有效性。
  • 德语翻译中连词显式化的频率更高,反映出语言特有的话语标记倾向。
  • 该方法成功识别出同一论元对之间存在多个共现话语关系的案例,凸显其对复杂话语结构的敏感性。
  • 定性分析证实,跨语言间一致的翻译行为增强了该方法学习可靠话语信号及替代词汇表达的能力。
  • 多数投票机制显著减少了噪声或不一致的标签,提升了所获取训练数据的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。