Skip to main content
QUICK REVIEW

[论文解读] Document-aligned Japanese-English Conversation Parallel Corpus

Matīss Rikters, Ryokan Ri|arXiv (Cornell University)|Dec 11, 2020
Natural Language Processing Techniques参考文献 17被引用 5
一句话总结

本文提出了一种高质量、文档对齐的日英对话平行语料库,旨在推动文档级机器翻译(MT)的发展。通过引入场景、说话人和上下文元数据,该语料库支持上下文感知MT模型的训练与评估,相较于句级基线模型,显著提升了对代词和模糊指代的处理能力——这是口语翻译中的关键挑战。

ABSTRACT

Sentence-level (SL) machine translation (MT) has reached acceptable quality for many high-resourced languages, but not document-level (DL) MT, which is difficult to 1) train with little amount of DL data; and 2) evaluate, as the main methods and data sets focus on SL evaluation. To address the first issue, we present a document-aligned Japanese-English conversation corpus, including balanced, high-quality business conversation data for tuning and testing. As for the second issue, we manually identify the main areas where SL MT fails to produce adequate translations in lack of context. We then create an evaluation set where these phenomena are annotated to alleviate automatic evaluation of DL systems. We train MT models using our corpus to demonstrate how using context leads to improvements.

研究动机与目标

  • 为解决对话翻译中缺乏高质量、文档对齐的平行语料库的问题,特别是针对日英等低资源语言对。
  • 支持文档级机器翻译(DL-MT)系统的训练与评估,此类系统需要超越单一句子的上下文信息。
  • 识别并标注语言现象(如代词指代、省略和词汇歧义),这些现象在句级MT中构成挑战,但可通过上下文解决。
  • 提供带有说话人、场景和文档级元数据的平衡开发集与评估集,以实现可复现的评估。
  • 证明上下文感知MT模型在翻译模糊或主语省略的语句时,优于句级基线模型。

提出的方法

  • 通过专业场景编写与翻译,构建了新的商务场景对话(BSD)子语料库,确保语言多样性与上下文准确性。
  • 将现有的英文对话语料库(AMI会议语料库和OntoNotes 5.0)翻译成日文,创建了两个额外的子语料库,具备对齐的文档与句级结构。
  • 标注说话人角色、场景和文档边界,以支持上下文感知MT的训练与评估。
  • 设计了两阶段众包评估:第一阶段为单一句子质量评估;第二阶段为连续句对的上下文一致性与准确性评估。
  • 使用自由边际kappa(Free-Marginal Kappa)衡量标注者间的一致性,获得中等一致性(kappa = 0.34),符合众包语言学评估的典型水平。
  • 通过专家验证识别出上下文依赖的翻译失败案例——尤其是代词遗漏与词汇歧义,并对歧义类型进行分类(例如,“Chinese”作为语言或食物)。

实验结果

研究问题

  • RQ1在日英对话翻译中,哪些语言现象因缺乏上下文而对句级MT构成最大挑战?
  • RQ2文档对齐的平行语料库在多大程度上能提升上下文感知神经机器翻译模型的性能?
  • RQ3与句级基线相比,上下文感知MT模型在代词翻译与词汇歧义消解方面能减少多少错误?
  • RQ4带有场景与说话人元数据的标注、平衡的开发与评估集,是否能实现更可靠且可复现的文档级MT系统评估?
  • RQ5不同类型的歧义(如代词、同音词)如何影响翻译质量?能否通过上下文系统性地识别与解决?

主要发现

  • 语料库包含2051对EN→JA方向的句子对和2051对JA→EN方向的句子对,其中第二轮评估中分别有228对EN→JA和208对JA→EN被标记为上下文不正确。
  • 经专家验证后,确认9对EN→JA和43对JA→EN句子对为上下文依赖性错误,主要源于代词遗漏或词汇歧义(如“Chinese”指语言或食物)。
  • 上下文感知MT模型在处理代词翻译方面优于句级基线模型,尽管在长距离上下文依赖方面仍存在困难。
  • 评估过程的自由边际kappa得分为0.34,表明标注者间达成中等一致,验证了人工评估流程的可靠性。
  • 语料库包含场景特定的元数据(如商务、会议、广播等),可支持对礼貌与正式程度的建模,从而提升对上下文敏感表达的翻译质量。
  • 发布内容包含完整元数据——源语言、说话人、场景、文档ID与歧义类型——为未来研究说话人感知与场景感知MT系统提供支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。