Skip to main content
QUICK REVIEW

[论文解读] scb-mt-en-th-2020: A Large English-Thai Parallel Corpus

Lalita Lowphansirikul, Charin Polpanumas|arXiv (Cornell University)|Jul 7, 2020
Natural Language Processing Techniques参考文献 31被引用 5
一句话总结

本论文介绍了 scb-mt-en-th-2020,这是一个大规模的英泰平行语料库,包含超过100万组句子对,数据来源多样,涵盖新闻、维基百科、短信、政府文件以及网络爬取的数据。通过使用通用句子编码器进行过滤,作者训练了基于Transformer的模型,在泰语→英语翻译任务中表现与谷歌翻译相当,当结合OPUS数据时则表现更优,在IWSLT 2015基准测试中达到当前最优性能。

ABSTRACT

The primary objective of our work is to build a large-scale English-Thai dataset for machine translation. We construct an English-Thai machine translation dataset with over 1 million segment pairs, curated from various sources, namely news, Wikipedia articles, SMS messages, task-based dialogs, web-crawled data and government documents. Methodology for gathering data, building parallel texts and removing noisy sentence pairs are presented in a reproducible manner. We train machine translation models based on this dataset. Our models' performance are comparable to that of Google Translation API (as of May 2020) for Thai-English and outperform Google when the Open Parallel Corpus (OPUS) is included in the training data for both Thai-English and English-Thai translation. The dataset, pre-trained models, and source code to reproduce our work are available for public use.

研究动机与目标

  • 为解决低资源机器翻译中高质量、多样化英泰平行数据稀缺的问题。
  • 开发一种可复现的方法,用于从异构来源收集、对齐并过滤大规模英泰句子对。
  • 在新语料库上训练并评估基于Transformer的机器翻译模型,并与谷歌翻译等商业API的性能进行比较。
  • 发布数据集、预训练模型和代码,以支持可复现性研究及泰语自然语言处理的进一步发展。
  • 探索领域多样性及其在低资源翻译设置中对模型泛化能力的影响。

提出的方法

  • 从六个来源收集了1,001,752组英泰句子对:新闻、维基百科、短信、基于任务的对话、网络爬取内容以及政府文件。
  • 由于缺乏正式的泰语句子分隔符,使用英文句子边界作为分段边界,并将模糊情况视为单一语段处理。
  • 应用通用句子编码器嵌入并结合余弦相似度,以过滤掉对齐错误或质量较低的句子对。
  • 采用多阶段预处理流程,包括去重、归一化以及基于相似度阈值的过滤,以确保数据质量。
  • 在scb-mt-en-th-2020和OPUS数据集上,使用子词级别和词级别分词方法训练基于Transformer的序列到序列模型。
  • 在IWSLT 2015和scb-mt-en-th-2020测试集上,使用SacreBLEU(区分大小写)评估模型性能;在OPUS测试集上使用BLEU4进行评估。

实验结果

研究问题

  • RQ1如何从异构的、低资源的数据源中构建大规模、多样化且高质量的英泰平行语料库?
  • RQ2训练数据中的领域多样性在多大程度上影响英泰和泰英机器翻译模型的性能?
  • RQ3在低资源设置下,自定义构建的语料库是否能够超越或匹配谷歌翻译等商业翻译API的性能?
  • RQ4通用句子编码器在过滤低资源平行数据中噪声或对齐错误的句子对方面有多有效?
  • RQ5在端到端翻译任务中,将所提出的语料库与现有数据集(如OPUS)结合,能带来多大的性能提升?

主要发现

  • scb-mt-en-th-2020语料库包含1,001,752组高质量的英泰句子对,覆盖新闻、政府文件、短信和口语对话等多种领域。
  • 仅在scb-mt-en-th-2020语料库上训练的模型,在泰语→英语的IWSLT 2015基准测试中,性能与2020年5月时的谷歌翻译API相当。
  • 当训练数据同时包含OPUS和scb-mt-en-th-2020语料库时,模型表现超越谷歌翻译,在泰语→英语翻译中提升0.24 BLEU点,在英语→泰语翻译中提升0.53 BLEU点。
  • 领域特定性能差异显著:在与测试集相同领域上训练的模型(如在SCB_1M上训练并在SCB_1M上测试)的BLEU得分比在不同领域上训练的模型(如在SCB_1M上训练但在OPUS上测试)高出4至8倍。
  • 通用句子编码器过滤方法有效减少了噪声句子对,但无法完全消除目标翻译中的充分性错误。
  • 数据集、预训练模型和源代码的发布,支持了可复现的研究,推动了泰语自然语言处理的发展,尤其是在低资源机器翻译领域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。