[论文解读] Filtering and Mining Parallel Data in a Joint Multilingual Space
本文提出一种联合多语言句子嵌入模型,利用共享嵌入空间中的余弦距离来过滤噪声平行数据,并从单语新闻语料库中挖掘平行句子。通过在 WMT'14 英德语任务上应用该方法,作者在过滤 25% 训练数据后,BLEU 分数提升 0.3 分,证明了该方法在无需模型特定调优的情况下,对多种语言对均有效。
We learn a joint multilingual sentence embedding and use the distance between sentences in different languages to filter noisy parallel data and to mine for parallel data in large news collections. We are able to improve a competitive baseline on the WMT'14 English to German task by 0.3 BLEU by filtering out 25% of the training data. The same approach is used to mine additional bitexts for the WMT'14 system and to obtain competitive results on the BUCC shared task to identify parallel sentences in comparable corpora. The approach is generic, it can be applied to many language pairs and it is independent of the architecture of the machine translation system.
研究动机与目标
- 开发一种通用的、与架构无关的方法,用于过滤噪声平行数据,并从可比语料库中挖掘双语语料。
- 解决神经机器翻译(NMT)系统对噪声训练数据的敏感性问题,该问题比统计机器翻译(SMT)更为严重。
- 通过在多达九种语言间共享单一嵌入空间,实现可扩展的多语言平行数据整理。
- 在不依赖语言特定特征或分类器的前提下,提升低资源和噪声双语语料上的 NMT 性能。
提出的方法
- 在九种语言(en, fr, es, it, pt, de, da, nl, fi)上使用 BPE 分词和 20k 联合词表,基于 Europarl 平行语料库训练共享的多语言 BLSTM 编码器。
- 通过最大池化操作对最终 BLSTM 隐状态进行处理,获得固定大小的 1024 维句子嵌入,并在训练后丢弃解码器。
- 利用共享空间中句子嵌入之间的余弦距离识别平行句子对:距离越低,表示翻译可能性越高。
- 对跨语言距离应用阈值,以过滤噪声双语语料(例如,丢弃距离 > 0.25 的句子对),并从可比语料库中挖掘新双语语料。
- 利用 FAISS 向量搜索库高效计算大规模单语新闻语料库(如 144M 英文和 187M 德文句子)中的成对距离。
- 使用相同的嵌入空间通过对比 BUCC 和 WMT 数据集中的标准对齐数据,评估挖掘质量。
实验结果
研究问题
- RQ1联合多语言句子嵌入空间是否能在不使用语言特定特征或分类器的情况下,有效识别并过滤噪声平行句子对?
- RQ2与现有方法相比,该方法在从大规模单语新闻语料库中挖掘高质量双语语料方面的有效性如何?
- RQ3过滤噪声双语语料在多大程度上能提升下游 NMT 性能,特别是在 WMT’14 等竞争性基准上的表现?
- RQ4挖掘句子的长度分布如何影响 NMT 训练?是否限制了性能提升?
- RQ5该嵌入空间是否可跨多种语言对和数据源(包括 Common Crawl 和 WMT 新闻语料库)复用?
主要发现
- 使用余弦距离阈值 0.25 过滤 WMT’14 英德语训练数据的 25% 后,BLEU 分数从 24.76 提升至 25.06,提升 0.3 分。
- 当将过滤后的 Common Crawl 数据(340 万句对)与原始 Europarl 和 News Commentary 数据结合时,BLEU 分数达到 25.07。
- 将从 WMT 新闻语料库中挖掘的双语语料加入 Europarl 和 News Commentary 数据后,NMT 性能提升 0.45 BLEU(从 21.87 提升至 22.32),但当加入已使用过滤后 Common Crawl 的最佳系统时,未观察到进一步增益。
- 该方法在 BUCC 共享任务中优于先前方法,性能优于使用独立嵌入空间和二元分类器的模型。
- 观察到长度分布不匹配:挖掘句子平均长度为 8 个词,而 WMT’14 训练数据平均长度为 24 个词,表明长序列翻译仍具挑战。
- 该方法具有通用性和可扩展性,适用于最多九种语言,且与 NMT 模型架构无关,具有在置信度估计和回译过滤中应用的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。