Skip to main content
QUICK REVIEW

[论文解读] Chinese Character Decomposition for Neural MT with Multi-Word Expressions

Lifeng Han, Gareth J. F. Jones|arXiv (Cornell University)|Apr 9, 2021
Natural Language Processing Techniques被引用 4
一句话总结

本文提出了一种新颖的神经机器翻译(NMT)框架,通过结合汉字的多层次分解(部首、笔画和中间形态)以及多词表达(MWE)的整合,以提升翻译性能。研究发现,一级(部首)和三级(笔画)分解能有效保留语义信息,并取得与完整字符相当的BLEU得分;而二级(中间形态)分解因引入语义误导的单位,反而损害了性能。

ABSTRACT

Chinese character decomposition has been used as a feature to enhance Machine Translation (MT) models, combining radicals into character and word level models. Recent work has investigated ideograph or stroke level embedding. However, questions remain about different decomposition levels of Chinese character representations, radical and strokes, best suited for MT. To investigate the impact of Chinese decomposition embedding in detail, i.e., radical, stroke, and intermediate levels, and how well these decompositions represent the meaning of the original character sequences, we carry out analysis with both automated and human evaluation of MT. Furthermore, we investigate if the combination of decomposed Multiword Expressions (MWEs) can enhance the model learning. MWE integration into MT has seen more than a decade of exploration. However, decomposed MWEs has not previously been explored.

研究动机与目标

  • 探究多层级汉字分解(部首、笔画和中间形态)对神经机器翻译的影响。
  • 评估分解表示是否能保留原始字符序列的语义意义。
  • 检验将多词表达(MWE)整合到NMT模型中,使用分解字符表示的有效性。
  • 开发并发布一个用于汉字分解的开源工具包,以及一个双语MWE标注语料库,供研究使用。
  • 比较自动评估(BLEU)与人工评估(直接评分)在不同分解层级和MWE整合策略下的结果。

提出的方法

  • 作者设计了一个多层级分解流程,将汉字分解为部首(一级)、笔画(三级)和中间字符(二级),其中二级表示形态上更小但语义上独立的字符。
  • 使用字符级、部首级和笔画级表示作为输入嵌入,训练一个带有注意力机制的序列到序列NMT模型。
  • 通过在训练和解码过程中将MWE视为单一单元来整合MWE,并从新发布的开源语料库中提取并标注双语MWE。
  • 采用直接评分(DA)方法进行人工评估,使用标准化z得分来评估不同系统之间的翻译质量。
  • 自动评估采用BLEU,未来工作计划使用METEOR和LEPOR进行显著性检验。
  • 采用IDS方法进行笔画级提取,但承认其在完整笔画级能力方面存在局限。

实验结果

研究问题

  • RQ1不同层级的汉字分解(部首、中间字符和笔画)如何影响NMT中的语义表征与翻译质量?
  • RQ2与标准字符级建模相比,整合分解后的多词表达(MWE)是否能提升NMT性能?
  • RQ3为何分解二级的表现劣于一级和三级,尽管其为中间表示?
  • RQ4部首与笔画级嵌入在多大程度上能保留原始字符序列的语义?
  • RQ5自动指标如BLEU与人工评估在不同分解层级上的翻译质量评估结果有多一致?

主要发现

  • 一级(部首)和三级(笔画)分解的BLEU得分与完整字符基线相当,表明语义保留有效。
  • 二级分解的人工评估得分显著低于一级和三级,原因在于引入了语义误导的中间字符,如「從」(cóng,从)和「王」(wáng,王)。
  • 人工评估显示,MWE整合与非整合模型之间无统计学显著差异,尽管前者在BLEU上有所提升。
  • 错误分析表明,二级分解会产生具有独立语义但与原字符语义不一致的字符,干扰模型学习。
  • 本研究证实,笔画级分解(三级)在NMT中具有可行性且具意义,但当前基于IDS的提取方法限制了完全的笔画级精度。
  • 作者发布了一个开源工具包和一个双语MWE标注语料库,以支持未来在字符分解与MWE感知NMT方面的研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。