QUICK REVIEW
[论文解读] Bitext Mining for Low-Resource Languages via Contrastive Learning
Weiting Tan, Philipp Koehn|arXiv (Cornell University)|Aug 23, 2022
Text and Document Classification Technologies被引用 4
一句话总结
该论文提出通过对比学习使用多重负样本排序损失微调句子编码器,以提升低资源语言的双语语料挖掘性能。该方法在高棉语和普什图语上取得了最先进结果,相比先前方法将神经机器翻译BLEU分数提升了超过1分,证明了其在改进跨语言句子表示后,句子对齐与过滤性能更优。
ABSTRACT
Mining high-quality bitexts for low-resource languages is challenging. This paper shows that sentence representation of language models fine-tuned with multiple negatives ranking loss, a contrastive objective, helps retrieve clean bitexts. Experiments show that parallel data mined from our approach substantially outperform the previous state-of-the-art method on low resource languages Khmer and Pashto.
研究动机与目标
- 提升低资源语言(如高棉语和普什图语)的双语语料挖掘质量,因这些语言的平行语料稀缺。
- 解决现有句子对齐与过滤流程中依赖启发式方法或次优句子表示的局限性。
- 开发一种稳健且可扩展的方法,利用跨语言句子嵌入的对比学习对句子对进行对齐与过滤。
- 在WMT 2020平行语料过滤任务中,超越现有最先进系统,适用于低资源语言对。
- 提供一个公开可用的工具包,以支持方法的复现与在其他语言对上的扩展。
提出的方法
- 使用多重负样本排序(MNR)损失微调句子-BERT(SBERT)模型,以学习改进的跨语言句子表示。
- 从对齐的句子对中构建正样本对,并利用目标语侧的邻近句子(窗口大小W)和随机采样(R)构建负样本对。
- 优化MNR损失,以最大化正样本对之间的余弦相似度,同时最小化与负样本对的相似度。
- 将微调后的SBERT嵌入作为Vecalign中句子对齐的评分函数,以及在基于边距的过滤机制中用于去除噪声对。
- 在过滤过程中使用Faiss进行高效的k近邻搜索,采用基于比率的边距函数对句子对进行排序。
- 在ParaCrawl提供的文档对齐语料上训练并评估系统,采用WMT 2020评估协议。
实验结果
研究问题
- RQ1通过对比学习对句子编码器进行微调,能否提升高棉语和普什图语等低资源语言的双语语料挖掘质量?
- RQ2MNR微调后的SBERT在句子对齐与过滤任务中,相较于LASER及其他最先进句子表示方法表现如何?
- RQ3使用对比学习目标是否能提升从噪声较大的网络爬取单语语料中挖掘平行语料的泛化能力与鲁棒性?
- RQ4句子表示的选择在低资源设置下的下游神经机器翻译性能中,影响程度如何?
- RQ5一个单一微调模型能否在提升效率与准确性的前提下,有效同时服务于对齐与过滤任务?
主要发现
- 使用MNR损失微调的SBERT模型在高棉语上达到11.83的BLEU分数,在普什图语上达到10.43,相比之前最先进系统提升超过1 BLEU分。
- SBERT-ALIGN与SBERT-FILTER结合后,在所有方法中取得最高BLEU分数,证明了微调表示在对齐与过滤任务中的有效性。
- 该方法在NMT性能上相比LASER-based的对齐与过滤方法提升约2 BLEU分,显示出显著改进。
- HUAWEI-FILTER在所有过滤技术中表现最佳,但SBERT-based的对齐与过滤仍大幅超越LASER-based方法。
- 微调后的SBERT模型在区分正确句子对与噪声对方面表现出更强能力,表现为正确对的相似度得分更高,错误对的得分更低,尤其在歧义或未登录词等复杂情况下表现更优。
- 该方法具备良好的可扩展性与高效性,利用预计算嵌入与Faiss-based近邻搜索,可在数百万句子对上实现快速推理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。