Skip to main content
QUICK REVIEW

[论文解读] ParaCotta: Synthetic Multilingual Paraphrase Corpora from the Most Diverse Translation Sample Pair

Alham Fikri Aji, Tirana Noor Fatyanosa|arXiv (Cornell University)|May 10, 2022
Natural Language Processing Techniques被引用 4
一句话总结

本文提出 ParaCotta,一种仅使用单语文本和神经机器翻译(NMT)系统生成合成多语言释义语料库的方法。通过使用束搜索生成多个翻译,并选择 BLEU 分数最低的一对(表示词汇多样性最高),该方法在 17 种语言中生成语义相似但词汇多样的释义对,发布了一个公开可用的数据集,在人工评估和语义相似度方面优于基线方法,同时保持了强大的词汇多样性。

ABSTRACT

We release our synthetic parallel paraphrase corpus across 17 languages: Arabic, Catalan, Czech, German, English, Spanish, Estonian, French, Hindi, Indonesian, Italian, Dutch, Romanian, Russian, Swedish, Vietnamese, and Chinese. Our method relies only on monolingual data and a neural machine translation system to generate paraphrases, hence simple to apply. We generate multiple translation samples using beam search and choose the most lexically diverse pair according to their sentence BLEU. We compare our generated corpus with the exttt{ParaBank2}. According to our evaluation, our synthetic paraphrase pairs are semantically similar and lexically diverse.

研究动机与目标

  • 为解决英语以外高质量多语言释义语料库稀缺的问题,提出一种可扩展、低资源的方法。
  • 生成在语义上相似且词汇上多样的释义对,而无需依赖平行双语语料库。
  • 开发一种仅依赖单语数据和预训练 NMT 系统的方法,以实现广泛的语言覆盖。
  • 发布一个涵盖 17 种语言的公开可用合成释义语料库,用于下游 NLP 任务。
  • 评估在合成释义生成中词汇多样性与语义相似度之间的权衡。

提出的方法

  • 使用预训练的英-目标语言 NMT 模型,通过束搜索从单语英语句子生成多个翻译样本。
  • 选择 BLEU 分数最低的一对翻译作为最终的释义对,基于假设:较低的 BLEU 分数表示更高的词汇多样性。
  • 使用单语英语语料库(例如 ParaBank2、Wikipedia、NewsCrawl、Tatoeba)作为释义生成的输入。
  • 将相同方法应用于 17 种语言:阿拉伯语、加泰罗尼亚语、捷克语、德语、英语、西班牙语、爱沙尼亚语、法语、印地语、印度尼西亚语、意大利语、荷兰语、罗马尼亚语、俄语、瑞典语、越南语和中文。
  • 通过 BLEU 阈值(例如 20–60 或 20–80)过滤生成的配对,以平衡语义相似度与词汇多样性。
  • 在合成释义语料库上训练基于 Transformer 的序列到序列模型,以评估其相对于基线方法(如往返机器翻译)的性能。

实验结果

研究问题

  • RQ1是否可以仅使用单语数据和预训练 NMT 系统有效生成合成释义语料库,而无需依赖平行双语语料库?
  • RQ2通过低 BLEU 分数选择最富词汇多样性的翻译对,是否能产生语义相似且词汇多样的释义对?
  • RQ3在语义相似度和词汇多样性方面,合成释义语料库的质量与 ParaBank2 等现有基准相比如何?
  • RQ4基于 BLEU 的过滤在多大程度上能改善合成释义对中语义相似度与词汇多样性之间的平衡?
  • RQ5该方法能否在大量低资源和高资源语言中生成高质量的释义数据?

主要发现

  • 在使用 BLEU 20–80 进行过滤后,ParaCotta 生成的释义语料库在印度尼西亚语数据集上的人工标注语义相似度得分为 88.9,优于未过滤的 ParaCotta 和往返机器翻译方法。
  • 经过过滤的 ParaCotta 语料库在保持高语义相似度(sBERT 余弦相似度为 92.1)的同时,BLEU 得分为 48.0,表明词汇多样性较强。
  • 与 ParaBank2 相比,该方法生成的释义对在 BLEU 和 Jaccard 指数上均表现出更高的多样性,同时仍保持较高的语义相似度。
  • 观察到较低的 BLEU 分数与更高的词汇多样性之间存在相关性,证实了使用 BLEU 作为多样性代理指标在选择过程中的有效性。
  • 该方法在语义相似度和词汇多样性方面均优于往返机器翻译,后者仅获得 78.1 的语义相似度得分。
  • 发布的数据集涵盖 17 种语言,公开获取地址为 https://github.com/afaji/paracotta-paraphrase,可广泛用于多语言 NLP 任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。