Skip to main content
QUICK REVIEW

[论文解读] JESC: Japanese-English Subtitle Corpus

Reid Pryzant, Yong-Joo Chung|arXiv (Cornell University)|Oct 29, 2017
Natural Language Processing Techniques参考文献 18被引用 3
一句话总结

本文提出了JESC,这是目前最大规模的公开日语-英语双语语料库,包含320万对字幕,专注于对话体语言。该语料库利用网络爬取和众包字幕数据,结合新颖的预处理方法以提升流畅度与对齐质量,实现了高质量的双语对齐,并在机器翻译基准测试中表现优异,尤其在分布外泛化能力方面优于现有数据集。

ABSTRACT

In this paper we describe the Japanese-English Subtitle Corpus (JESC). JESC is a large Japanese-English parallel corpus covering the underrepresented domain of conversational dialogue. It consists of more than 3.2 million examples, making it the largest freely available dataset of its kind. The corpus was assembled by crawling and aligning subtitles found on the web. The assembly process incorporates a number of novel preprocessing elements to ensure high monolingual fluency and accurate bilingual alignments. We summarize its contents and evaluate its quality using human experts and baseline machine translation (MT) systems.

研究动机与目标

  • 为解决在对话体日语-英语语言这一代表性不足的领域中大规模高质量双语语料库稀缺的问题。
  • 通过提供来自粉丝字幕媒体的大型多样化数据集,提升机器翻译系统对非正式口语语言的泛化能力。
  • 开发并发布一个预处理流程,以提升噪声大、众包来源的字幕数据中单语流畅度与双语对齐准确率。
  • 构建一个支持多参考译文BLEU评估的数据集,该特性在大型双语语料库中极为罕见,可提升翻译质量评估的可靠性。
  • 发布完整的语料库、工具、爬虫程序与解析器,以支持自然语言处理研究中的可复现性与更广泛应用。

提出的方法

  • 从四个公开仓库(kitsunekko.net、d-addicts.com、opensubtitles.org、subscene.com)爬取字幕,共收集超过1亿条字幕,覆盖23,318部作品。
  • 使用ffmpeg和chardet将所有字幕文件标准化为UTF-8编码与.srt格式,随后解析为带时间戳和文本的结构化YAML格式。
  • 应用基于Birkbeck语料库训练的拉普拉斯平滑统计错误模型,以纠正英语字幕中的拼写与打字错误。
  • 通过时间戳匹配实现日语与英语字幕之间的基于时间的对齐,随后进行过滤步骤以去除对齐错误的配对。
  • 实施多参考译文设置,其中163,665个日语短语与130,790个英语短语拥有多个翻译版本,从而增强评估的稳健性。
  • 在子词分词数据(16k共享词表)上,使用双向LSTM、注意力机制、Dropout与Adam优化方法训练序列到序列模型,用于下游机器翻译评估。

实验结果

研究问题

  • RQ1尽管输入数据存在噪声,大规模网络爬取的粉丝字幕媒体双语语料库是否能实现高质量的双语对齐与单语流畅度?
  • RQ2与较小规模、正式领域为主的语料库相比,大规模对话领域日语-英语双语语料库是否能显著提升神经机器翻译模型在分布外场景下的泛化能力?
  • RQ3字幕中来自众包、非专业译者的翻译在多大程度上保持了翻译的准确度与流畅度,使其适合用于训练机器翻译系统?
  • RQ4在大型双语语料库中引入多参考译文对,是否能显著提升BLEU分数并提供更稳健的评估基准?
  • RQ5与ASPEC、OpenSubs和KWC等现有语料库相比,JESC在规模与领域多样性方面如何影响下游机器翻译性能?

主要发现

  • JESC包含320万对平行句子,是迄今为止最大规模的公开日语-英语双语语料库。
  • 人工评估显示75%的句子对完全对齐,Cohen’s kappa值为0.76,表明标注者间一致性高,对齐质量可靠。
  • 翻译的JPO准确度平均得分为4.82(满分5分),证实尽管源自非正式来源,众包字幕仍保持了高水平的翻译质量。
  • 在机器翻译评估中,JESC在自身测试集上达到14.21的BLEU分数,优于OpenSubs(10.01)与ASPEC(36.23)在分布外泛化能力上的表现,尽管ASPEC规模更大。
  • 在JESC上训练的模型比在更小或更正式语料库上训练的模型泛化能力更强,证明了对话体数据对提升机器翻译鲁棒性的价值。
  • 对超过13万个短语提供多参考译文,使评估更加可靠且细致,这一特性在大多数大规模机器翻译基准中尚属缺失。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。