[论文解读] Identifying Computer-Translated Paragraphs using Coherence Features
本文提出一种基于段落级别的方法,通过词性(POS)词匹配生成的连贯性特征来检测机器翻译文本。通过引入 POSMat 和 MatPen 指标来计算段落连贯性得分(ParaCoh),该方法在德语上的准确率达到 72.3%,Equal Error Rate(EER)为 29.8%,在翻译检测与论文生成检测任务中均优于先前方法。
We have developed a method for extracting the coherence features from a paragraph by matching similar words in its sentences. We conducted an experiment with a parallel German corpus containing 2000 human-created and 2000 machine-translated paragraphs. The result showed that our method achieved the best performance (accuracy = 72.3%, equal error rate = 29.8%) when it is compared with previous methods on various computer-generated text including translation and paper generation (best accuracy = 67.9%, equal error rate = 32.0%). Experiments on Dutch, another rich resource language, and a low resource one (Japanese) attained similar performances. It demonstrated the efficiency of the coherence features at distinguishing computer-translated from human-created paragraphs on diverse languages.
研究动机与目标
- 为解决识别机器翻译段落的挑战,这些段落通常比人工撰写的内容连贯性更低。
- 探究段落级连贯性特征是否能有效区分机器翻译与人工创作的文本。
- 开发一种方法,利用句子间的词相似性与结构关系来量化连贯性。
- 在多种语言上评估该方法,包括高资源语言(德语、荷兰语)和低资源语言(日语)。
- 通过识别翻译文本中的连贯性缺陷,支持提升机器翻译质量。
提出的方法
- 提出一种基于词性的词匹配指标 POSMat,通过词性对识别段落中句子之间的相似词并进行评分。
- 引入一种匹配惩罚指标 MatPen,以降低未匹配或错误匹配词对在连贯性估计中的影响。
- 将 POSMat 与 MatPen 综合为统一的段落连贯性得分 ParaCoh,以量化段落的整体连贯性。
- 使用基于 ParaCoh 特征训练的线性分类器(LINEAR)将段落分类为人工创作或机器翻译。
- 使用平行语料:2000 个由人工创作的英文 TED 演讲段落及其对应的德语翻译,机器翻译版本通过 Google Translate 生成。
- 将评估扩展至荷兰语(高资源语言)和日语(低资源语言),使用类似的平行段落语料集。
实验结果
研究问题
- RQ1段落级连贯性特征能否有效区分机器翻译与人工创作的段落?
- RQ2基于 POS 匹配词对的连贯性特征与句子级或文档级特征相比,在检测机器翻译方面表现如何?
- RQ3所提出的方法是否能在资源水平各异的语言(如德语、荷兰语和日语)间实现泛化?
- RQ4特定词性对(如 VB-VBG、VBG-RB)在区分翻译缺陷方面贡献有多大?
- RQ5ParaCoh 指标能否作为在多样化语言语境下评估机器翻译质量的可靠代理指标?
主要发现
- 基于 ParaCoh 的方法在德语平行段落上实现了 72.3% 的准确率和 29.8% 的等错误率(EER),优于先前方法(准确率 67.9%,EER 32.0%)在类似检测任务中的表现。
- 在荷兰语(高资源语言)上,该方法表现与德语相当,表明其具备强大的跨语言泛化能力。
- 在日语(低资源语言)上,该方法表现甚至优于德语和荷兰语,表明在低资源环境下可能存在潜在优势。
- 表现最佳的词性对为 VB-VBG(准确率 63.7%)、VBG-RB(63.6%)和 VBG-NN(63.5%),表明动词与副词或名词的配对是翻译缺陷的强指标。
- 该方法显著优于基于文档级分布的检测器(Labbé 和 Labbé, 2013),后者在所有语言中表现最差,原因在于翻译中词分布的同步性。
- 基于 ParaCoh 特征的 LINEAR 分类器取得了最佳整体性能,证实了该连贯性指标作为判别性特征的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。