[论文解读] SMT vs NMT: A Comparison over Hindi & Bengali Simple Sentences.
本研究对比了统计机器翻译(SMT)与神经机器翻译(NMT)在英语-印地语和英语-孟加拉语简单句上的表现,采用Moses实现SMT,同时使用字符级和词级NMT(均采用软注意力机制)。结果表明,NMT在简单句上优于SMT,但当在混合复杂度语料上进行训练时,SMT反而超越NMT,凸显了数据复杂度与训练语料构成在机器翻译性能中的关键作用。
In the present article, we identified the qualitative differences between Statistical Machine Translation (SMT) and Neural Machine Translation (NMT) outputs. We have tried to answer two important questions: 1. Does NMT perform equivalently well with respect to SMT and 2. Does it add extra flavor in improving the quality of MT output by employing simple sentences as training units. In order to obtain insights, we have developed three core models viz., SMT model based on Moses toolkit, followed by character and word level NMT models. All of the systems use English-Hindi and English-Bengali language pairs containing simple sentences as well as sentences of other complexity. In order to preserve the translations semantics with respect to the target words of a sentence, we have employed soft-attention into our word level NMT model. We have further evaluated all the systems with respect to the scenarios where they succeed and fail. Finally, the quality of translation has been validated using BLEU and TER metrics along with manual parameters like fluency, adequacy etc. We observed that NMT outperforms SMT in case of simple sentences whereas SMT outperforms in case of all types of sentence.
研究动机与目标
- 评估NMT在英语-印地语与英语-孟加拉语等低资源语言对的简单句上是否优于SMT。
- 探究仅在简单句上训练机器翻译模型是否能提升翻译质量。
- 分析在不同数据复杂度与模型架构下,SMT与NMT之间的性能差异。
- 通过人工与自动评估相结合的方式,利用BLEU、TER、流畅性与充分性指标验证翻译质量。
提出的方法
- 利用基于规则的方法,结合Stanford依存解析器识别单分句结构,从TDIL授权的英语-印地语与英语-孟加拉语双语语料库中提取简单句。
- 使用Moses工具包在简单句语料与全复杂度语料上训练SMT系统。
- 开发两种NMT模型:一种为字符级NMT(CNMT),另一种为词级NMT(WNMT),后者采用软注意力机制以改善对齐效果。
- 对词级NMT分别采用与不采用注意力机制(WNMT(A)与WNMT(NA))进行实验,以评估注意力机制对翻译质量的影响。
- 通过自动指标(BLEU与TER)及母语者对流畅性与充分性的手动评估来评估各系统性能。
- 手动评估采用五分制评分,由四位语言学家(每种语言各两名)在多个测试集上对翻译结果进行评分。
实验结果
研究问题
- RQ1当在英语-印地语与英语-孟加拉语翻译任务中仅使用简单句进行训练时,NMT是否优于SMT?
- RQ2与混合复杂度训练数据相比,仅在简单句上训练机器翻译模型是否能提升翻译质量?
- RQ3在低资源语言对上,字符级与词级NMT模型的性能表现如何比较?
- RQ4软注意力机制对这些语言对的词级NMT输出质量有何影响?
- RQ5在何种场景下SMT优于NMT?其背后的关键因素是什么?
主要发现
- NMT在简单句上优于SMT:在英语-孟加拉语简单句上,采用注意力机制的词级NMT(WNMT(A))取得9.95的BLEU分数与85.66的TER,而SMT的BLEU为0,TER为117.67。
- SMT在混合复杂度语料上优于NMT:在英语-孟加拉语任务中,SMT取得85.26的BLEU与15.9的TER,而表现最佳的NMT模型(WNMT带注意力)仅取得9.95的BLEU与85.66的TER。
- 采用注意力机制的词级NMT(WNMT(A))在孟加拉语翻译中达到最高的平均充分性(2.08)与流畅性(2.12),优于SMT与字符级NMT。
- 字符级NMT(CNMT)表现劣于词级NMT,其在简单英语-孟加拉语句子上的BLEU得分为8.69,表明在低资源环境下存在局限性。
- 在英语-印地语任务中,SMT在全语料上的BLEU得分为12.86,而最佳NMT模型(WNMT带注意力)得分为10.54,证实SMT在复杂数据上的优势。
- 人工评估结果表明,SMT在复杂句上生成的翻译更具流畅性与充分性,而NMT在简单句上表现更优,尤其在采用注意力机制时优势更为明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。