Skip to main content
QUICK REVIEW

[论文解读] A Parallel Evaluation Data Set of Software Documentation with Document Structure Annotation

Bianka Buschbeck, Miriam Exel|arXiv (Cornell University)|Aug 11, 2020
Natural Language Processing Techniques参考文献 17被引用 5
一句话总结

本文介绍了从SAP帮助门户获取的并行企业软件文档评估数据集,涵盖英语到印地语、印度尼西亚语、马来语和泰语的文档结构元数据(如标题、表格、段落边界)标注。该数据集支持上下文感知机器翻译评估与基准测试,基线结果表明多语言模型与商业在线机器翻译系统之间存在显著性能差距,凸显了在低资源环境下进行领域特定调优和元数据利用的潜力。

ABSTRACT

This paper accompanies the software documentation data set for machine translation, a parallel evaluation data set of data originating from the SAP Help Portal, that we released to the machine translation community for research purposes. It offers the possibility to tune and evaluate machine translation systems in the domain of corporate software documentation and contributes to the availability of a wider range of evaluation scenarios. The data set comprises of the language pairs English to Hindi, Indonesian, Malay and Thai, and thus also increases the test coverage for the many low-resource language pairs. Unlike most evaluation data sets that consist of plain parallel text, the segments in this data set come with additional metadata that describes structural information of the document context. We provide insights into the origin and creation, the particularities and characteristics of the data set as well as machine translation results.

研究动机与目标

  • 解决企业软件文档机器翻译领域缺乏高质量、领域特定评估数据的问题。
  • 通过引入文档结构元数据(如文本类型、边界)提升评估保真度,支持上下文感知翻译系统评估。
  • 通过提供并行开发集与测试集,支持对低资源语言对(印地语、印度尼西亚语、马来语、泰语)的研究。
  • 在真实企业IT文档领域建立上下文感知与文本类型特定翻译模型的评估基准。
  • 超越新闻领域语料,实现更准确、更具代表性的机器翻译评估,推动专用领域向人类水平逼近。

提出的方法

  • 数据集从SAP帮助门户提取,每对语言包含约4,000个并行语段(EN-HI、EN-ID、EN-MS、EN-TH及反向对)。
  • 语段在文档上下文中保持完整,并标注了文档与段落边界以及文本类型(如标题、表格、章节)等元数据。
  • 通过控制语段长度、文本类型分布及各类文本类型的词数,将数据划分为开发集与测试集,确保模型调优与评估的一致性。
  • 基线机器翻译结果基于在Wikinews和IT数据(Opus)上训练的多语言Transformer模型生成,并与商业在线机器翻译服务提供商进行对比。
  • 评估指标包括区分大小写的BLEU与ChrF,官方BLEU分数依据WAT 2020基线系统报告。
  • 该数据集以CC BY-NC 4.0许可发布,并托管于GitHub,供机器翻译研究领域公开访问与再利用。

实验结果

研究问题

  • RQ1多语言神经机器翻译模型在低资源软件文档上的表现与商业在线机器翻译系统相比如何?
  • RQ2文档结构元数据在上下文感知机器翻译系统中能在多大程度上提升翻译质量?
  • RQ3与测试集特征相近的开发集能否有效支持软件文档翻译的模型调优?
  • RQ4在企业IT领域,不同低资源语言对的翻译结果有何差异?
  • RQ5使用领域内数据与元数据对低资源环境下的翻译质量提升有何影响?

主要发现

  • 商业在线机器翻译服务提供商在所有语言对上均显著优于WAT 2020多语言基线系统,其在EN-TH上的BLEU得分为68.80,而基线系统仅为31.29。
  • WAT基线系统在EN-HI上的BLEU得分为13.67,表明在低资源环境下仍有巨大提升空间。
  • 各语言对的开发集与测试集在语段长度分布、文本类型频率及各类文本类型词数方面具有可比性,支持可靠的模型调优。
  • 数据集的文档结构标注为训练与评估上下文感知机器翻译系统奠定了基础,尤其适用于标题与表格等特定文本类型。
  • 该数据集支持利用元数据的系统进行基准测试,为提升企业软件文档翻译质量提供了可行路径。
  • 该数据集的发布支持了低资源机器翻译、领域自适应与元数据利用的研究,有望推动专用领域向人类水平逼近。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。