[论文解读] CUNI Systems for the WMT22 Czech-Ukrainian Translation Task
本论文介绍了查理大学在WMT22捷克语-乌克兰语翻译共享任务中的参赛系统,包含两种使用块式反向翻译和标记反向翻译的受限系统,以及一个专有系统Charles Translator。乌克兰语文本的罗马化对翻译质量影响极小,而块式反向翻译略优于标记反向翻译,最终在测试集上的BLEU得分达到35.0(cs→uk)和35.8(uk→cs)。
We present Charles University submissions to the WMT22 General Translation Shared Task on Czech-Ukrainian and Ukrainian-Czech machine translation. We present two constrained submissions based on block back-translation and tagged back-translation and experiment with rule-based romanization of Ukrainian. Our results show that the romanization only has a minor effect on the translation quality. Further, we describe Charles Translator, a system that was developed in March 2022 as a response to the migration from Ukraine to the Czech Republic. Compared to our constrained systems, it did not use the romanization and used some proprietary data sources.
研究动机与目标
- 为应对俄罗斯入侵乌克兰后引发的人道主义危机,开发高质量的低资源捷克语-乌克兰语机器翻译系统。
- 评估基于规则的乌克兰西里尔字母文本罗马化在改善语义相近的斯拉夫语种之间跨语言迁移方面的有效性。
- 对比受限反向翻译技术(块式与标记式)与使用专有数据训练的非受限系统在性能上的差异。
- 评估数据预处理措施(包括单语数据过滤与人工噪声注入)对翻译质量的影响。
- 为移民支持场景提供一个实用、可投入生产的翻译系统(Charles Translator),支持实时使用。
提出的方法
- 使用Marian NMT工具包实施块式反向翻译,通过反向翻译合成目标语句生成的单语数据,训练序列到序列模型。
- 在Tensor2Tensor框架中实现标记反向翻译,通过特殊标记在反向翻译过程中保留源语言身份。
- 开发了一种可逆的、基于规则的罗马化系统,利用捷克语语音规则将乌克兰西里尔字母映射为拉丁字母,以实现词汇相似性的利用。
- 使用FastText进行语言检测、长度比例过滤以及基于正则表达式的非翻译元素(如电子邮件和专有名词)移除,对平行语料和单语语料进行过滤。
- 对源语句应用合成噪声以提升鲁棒性,采用字符级破坏技术。
- 在NewsCrawl数据上训练一个轻量级Transformer模型,用于恢复标点符号并重新分词已分词且去除标点的单语乌克兰语文本。
实验结果
研究问题
- RQ1基于规则的乌克兰西里尔字母文本罗马化是否显著提升低资源捷克语-乌克兰语机器翻译的质量?
- RQ2在WMT22测试集上,块式反向翻译与标记反向翻译在BLEU、chrF和COMET得分上的表现如何比较?
- RQ3数据预处理选择(如过滤、噪声注入、单语数据清洗)在多大程度上影响系统性能?
- RQ4在实际部署场景中,基于公共数据训练的受限系统与使用专有数据的非受限系统(Charles Translator)的性能差异如何?
- RQ5学习率等超参数(如批量大小)对翻译质量的影响有多大,尤其是在与网络架构或数据增强技术对比时?
主要发现
- 乌克兰西里尔字母文本的罗马化对翻译质量仅有微小影响,且在任一翻译方向上均未表现出一致的性能提升。
- 块式反向翻译略优于标记反向翻译,在WMT22测试集上的BLEU得分分别为35.0(cs→uk)和35.8(uk→cs)。
- 未使用罗马化的非受限系统Charles Translator(基于专有数据训练)取得了具有竞争力的结果,BLEU得分分别为34.3(cs→uk)和35.9(uk→cs),与受限系统表现相当。
- 集成多个模型仅带来微小的性能提升,表明初始化或数据增强方式的多样性对性能影响有限。
- 批量大小对性能的影响强于大多数数据增强或预处理技术;一个批量大小为其他系统3倍的西里尔字母系统,尽管架构完全相同,仍表现更优。
- 由于缺乏训练数据,COMET得分在此语言对上不可靠,因此BLEU和chrF成为更具信息量的评估指标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。