QUICK REVIEW
[论文解读] The UN Parallel Corpus Annotated for Translation Direction
Elad Tolochinsky, Ohad Mosafi|ArXiv.org|May 20, 2018
Natural Language Processing Techniques参考文献 3被引用 6
一句话总结
本文提出了一种从联合国平行语料库中人工标注的平行语料库,通过监督分类方法对翻译方向(原文 vs. 译文)进行标注。该方法在多个语种对中区分译文与原文的准确率最高可达95%,为自然语言处理研究提供了宝贵的资源。
ABSTRACT
This work distinguishes between translated and original text in the UN protocol corpus. By modeling the problem as classification problem, we can achieve up to 95% classification accuracy. We begin by deriving a parallel corpus for different language-pairs annotated for translation direction, and then classify the data by using various feature extraction methods. We compare the different methods as well as the ability to distinguish between translated and original texts in the different languages. The annotated corpus is publicly available.
研究动机与目标
- 为解决在平行语料库中识别给定文本是否为原始撰写或翻译的问题。
- 创建一个高质量、公开可用的平行语料库,涵盖多种语种对的翻译方向标注。
- 评估各种特征提取方法在区分译文与原文文本中的有效性。
- 分析分类模型在不同语言及语种对中的性能差异。
- 提供一种支持下游自然语言处理任务(如机器翻译、风格建模和语言分析)的资源。
提出的方法
- 作者将翻译方向检测问题建模为二分类问题:原文 vs. 译文。
- 提取包括词汇、句法和分布统计在内的语言学特征,以表征每个文本片段。
- 评估多种特征提取技术,包括n-gram频率、词性模式和词汇多样性度量。
- 使用监督学习模型(如SVM或类似模型)在标注数据上进行训练,以按翻译方向分类文本片段。
- 在联合国平行语料库的平行句子对上进行模型的训练与测试,覆盖多种语种对。
- 使用标准指标(如准确率)对最终模型进行评估,并测试其在不同语种对之间的跨语言泛化能力。
实验结果
研究问题
- RQ1语言学特征能否有效区分多语种平行语料库中的原文与译文?
- RQ2在联合国平行语料库中,分类性能在不同语种对之间如何变化?
- RQ3哪种特征提取方法在识别翻译方向时能获得最高准确率?
- RQ4该模型在不同语言间的泛化程度如何?是否存在与语言相关的翻译方向检测模式?
- RQ5该标注语料库在多大程度上提升了涉及平行文本的下游自然语言处理应用的可靠性?
主要发现
- 所提出的分类模型在识别文本片段是否为原文或译文时,最大准确率达到95%。
- 结合词汇多样性、词性模式和n-gram频率的特征集能取得最强的分类性能。
- 该模型在多种语种对中表现一致良好,尽管性能在不同源语种和目标语种间略有差异。
- 已公开发布标注语料库,支持研究的可复现性及在自然语言处理研究中的更广泛应用。
- 即使在低资源语种对中,也可通过语言学特征实现高精度的翻译方向检测。
- 本研究表明,译文通常表现出更高的词汇重复率和更简单的句法结构,相较于原文。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。