[论文解读] An Arabic-Hebrew parallel corpus of TED talks
本文提出一个高质量的阿拉伯语-希伯来语平行语料库,包含约2,000场TED演讲,每种语言约350万个词元,以及22.5万对对齐的句子对。该语料库通过以英语为中间语言重新组合字幕,将阿拉伯语和希伯来语翻译中的分段与标点不一致问题解决,从而实现更一致的句子对齐,基线机器翻译结果表现与最先进系统相当。
We describe an Arabic-Hebrew parallel corpus of TED talks built upon WIT3, the Web inventory that repurposes the original content of the TED website in a way which is more convenient for MT researchers. The benchmark consists of about 2,000 talks, whose subtitles in Arabic and Hebrew have been accurately aligned and rearranged in sentences, for a total of about 3.5M tokens per language. Talks have been partitioned in train, development and test sets similarly in all respects to the MT tasks of the IWSLT 2016 evaluation campaign. In addition to describing the benchmark, we list the problems encountered in preparing it and the novel methods designed to solve them. Baseline MT results and some measures on sentence length are provided as an extrinsic evaluation of the quality of the benchmark.
研究动机与目标
- 解决机器翻译研究中阿拉伯语-希伯来语平行语料库缺乏高质量、人工校对资源的问题。
- 解决阿拉伯语和希伯来语TED演讲字幕在分段与标点上的不一致性。
- 创建一个标准化基准,其训练集、开发集和测试集与IWSLT 2016评估活动对齐。
- 通过利用英语作为中间语言重构原始句子边界,提升句子级别的对齐质量。
- 为阿拉伯语-希伯来语方向的神经网络与短语基于机器翻译系统提供可靠的训练与评估资源。
提出的方法
- 该语料库基于WIT 3发布的英语、阿拉伯语和希伯来语TED演讲字幕XML版本构建。
- 通过时间戳将字幕在字幕片段级别对齐,随后利用英语作为中间语言将片段重新组合为完整句子。
- 评估了三种句子重构方法:(1) 不重建(原始字幕片段),(2) 基于强标点的重建(strngP),(3) 利用英语句子结构的中间语言重建。
- 中间方法利用英语字幕中的语言线索,指导阿拉伯语和希伯来语中的句子分段,纠正缺失或不一致的标点。
- 最终语料库按照IWSLT 2016的划分方式划分为训练集、开发集和测试集,以确保与现有机器翻译基准的兼容性。
- 通过测量句子长度与对齐质量来评估各方法的有效性,结果显示中间方法在稳定性和语言合理性方面表现更优。
实验结果
研究问题
- RQ1如何纠正阿拉伯语和希伯来语TED演讲翻译中不一致的字幕分段与标点问题,以改善句子级别的对齐?
- RQ2使用英语作为中间语言在多大程度上能提升阿拉伯语-希伯来语平行语料库中句子重构的质量与一致性?
- RQ3句子重构方法的选择如何影响下游机器翻译系统的性能?
- RQ4由于语言间分段差异导致的字幕失步,对机器翻译模型的训练与评估有何影响?
- RQ5与现有阿拉伯语-希伯来语平行语料库相比,该最终基准在规模、质量及机器翻译研究适用性方面表现如何?
主要发现
- 最终的阿拉伯语-希伯来语平行语料库包含约2,000场TED演讲,22.5万对句子对,每种语言约350万个词元,其训练/开发/测试划分与IWSLT 2016基准对齐。
- 基于中间语言的句子重构方法产生的句子长度方差更低,且超过100个词元的句子比例显著减少(0.7‰),相比强标点方法(3.0–3.4‰),表明其语言质量更优。
- 与strngP方法相比,中间方法将长句(难以处理的句子)数量减少了四至五倍,显著提升了自然语言处理任务的可用性。
- 在该基准上训练的基线机器翻译系统达到的BLEU分数与最先进水平的短语基于和神经机器翻译系统相当,且与Google翻译性能持平,验证了语料库的质量。
- 该语料库有效解决了9%的演讲中译者偏离英语字幕边界所导致的分段问题,通过基于中间语言的重构恢复了对齐。
- 该语料库已公开发布于 wit3.fbk.eu/mt.php?release=2016-01-more,支持阿拉伯语-希伯来语机器翻译的可复现训练与评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。