[论文解读] Incorporating Syntactic Uncertainty in Neural Machine Translation with Forest-to-Sequence Model
本文提出了一种基于森林的序列注意力神经机器翻译模型,通过利用紧凑的句法解析树森林来建模句法不确定性,从而提升翻译的鲁棒性。通过在指数级数量的解析树上使用动态规划,该模型减少了对易出错的单棵解析树的依赖,在英语到德语、中文和波斯语的翻译任务中,BLEU分数均高于基于树的序列模型和标准序列到序列模型。
Incorporating syntactic information in Neural Machine Translation models is a method to compensate their requirement for a large amount of parallel training text, especially for low-resource language pairs. Previous works on using syntactic information provided by (inevitably error-prone) parsers has been promising. In this paper, we propose a forest-to-sequence Attentional Neural Machine Translation model to make use of exponentially many parse trees of the source sentence to compensate for the parser errors. Our method represents the collection of parse trees as a packed forest, and learns a neural attentional transduction model from the forest to the target sentence. Experiments on English to German, Chinese and Persian translation show the superiority of our method over the tree-to-sequence and vanilla sequence-to-sequence neural translation models.
研究动机与目标
- 解决在神经机器翻译中依赖单个、易出错的解析树所带来的局限性。
- 通过建模句法不确定性,提升低资源语言对和语言差异较大的语言对的翻译性能。
- 开发一种高效方法,以捕捉源句可能的句法结构分布。
- 证明使用解析树森林的模型在翻译质量上优于基于1-best树和标准序列到序列基线模型。
提出的方法
- 将源句可能的解析树集合表示为紧凑的、压缩的森林数据结构。
- 采用自底向上的动态规划方法,同时从森林中所有树计算短语嵌入。
- 扩展标准的注意力编码器-解码器框架,使其能够同时关注来自森林的词级和短语级嵌入。
- 使用改进的注意力机制,基于森林中单个词和句法短语计算上下文向量。
- 使用随机梯度下降进行端到端训练,并在开发集上采用早停策略。
- 推理时采用束搜索解码,结合贪婪解码,使用BLEU分数进行评估。
实验结果
研究问题
- RQ1通过解析树森林建模句法不确定性,能否提升神经机器翻译的性能?
- RQ2基于森林的序列模型是否优于基于单棵1-best解析树或标准序列到序列架构的模型?
- RQ3该模型在不同句长以及句法解析不确定性不同的语言对上的表现如何变化?
- RQ4在使用森林与单棵树时,模型中的注意力机制在多大程度上聚焦于短语级表示?
主要发现
- 在英语到德语、英语到中文和英语到波斯语这三种语言对上,该森林到序列模型的BLEU分数均高于基于树的序列模型和标准序列到序列模型。
- 该模型在所有句长区间内均表现出一致的性能提升,表明即使对短句也具有优势,而不仅限于长句。
- 在英语到波斯语数据集上观察到最大的性能提升(最高达0.7 BLEU分),该数据集表现出最高的解析不确定性。
- 注意力分析显示,与基于树的模型相比,森林模型显著增加了对短语级嵌入的关注,表明其更充分地利用了句法结构。
- 该模型有效利用了森林中解析树的多样性,以补偿解析器错误,表现出对句法歧义的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。