Skip to main content
QUICK REVIEW

[论文解读] Faster decoding for subword level Phrase-based SMT between related languages

Anoop Kunchukuttan, Pushpak Bhattacharyya|arXiv (Cornell University)|Nov 1, 2016
Natural Language Processing Techniques参考文献 18被引用 5
一句话总结

本文提出优化技术以加速相关语言的子词级短语基于统计机器翻译(SMT)中的解码过程,重点聚焦于解码器参数和数据格式。通过使用剪枝限制减少的立方体剪枝(cube-pruning)以及选择空格或边界标记格式表示子词,解码速度显著提升——最高达19倍,同时保持与词级解码相当的翻译质量。

ABSTRACT

A common and effective way to train translation systems between related languages is to consider sub-word level basic units. However, this increases the length of the sentences resulting in increased decoding time. The increase in length is also impacted by the specific choice of data format for representing the sentences as subwords. In a phrase-based SMT framework, we investigate different choices of decoder parameters as well as data format and their impact on decoding time and translation accuracy. We suggest best options for these settings that significantly improve decoding time with little impact on the translation accuracy.

研究动机与目标

  • 解决在使用子词单元时短语基于SMT系统解码时间过长的问题,因为这会增加句子长度并降低效率。
  • 研究不同子词表示格式(边界、内部、空格标记)对解码时间和翻译准确率的影响。
  • 评估解码器参数(尤其是立方体剪枝和堆栈弹出限制)对解码性能和翻译质量的影响。
  • 在不显著损失翻译质量的前提下,减少子词级SMT的调优和解码时间,从而实现更快的实验和部署。
  • 为低资源、相关语言环境下的高效子词级SMT部署提供实用建议。

提出的方法

  • 采用正字法音节作为子词单元来表示句子,以减轻形态复杂性的影响。
  • 评估了三种子词表示格式:边界标记、内部标记和空格标记,以评估其对解码时间和准确率的影响。
  • 在调优和测试阶段均应用立方体剪枝,通过早期剪除较不具前景的假设来加速解码。
  • 调整解码器中的堆栈弹出限制参数以控制活动假设的数量,测试较低值以减轻计算负载。
  • 使用ILCI平行语料库对四组语言对(印地语-马拉雅拉姆语、孟加拉语-印地语、泰卢固语-马拉雅拉姆语等)进行性能评估,涵盖相关性较高的印度-雅利安语和德拉维迪语。
  • 将解码时间与词级解码进行相对比较,并报告BLEU分数以评估翻译质量的权衡。

实验结果

研究问题

  • RQ1子词表示格式的选择(边界、内部、空格标记)如何影响短语基于SMT中的解码时间和翻译准确率?
  • RQ2在调优和测试阶段使用立方体剪枝,能在多大程度上提升解码速度,同时对翻译质量影响最小?
  • RQ3在子词级SMT中,平衡解码速度和翻译性能的最优堆栈弹出限制值是多少?
  • RQ4立方体剪枝与高效数据格式的结合能否在不降低翻译质量的前提下减少调优和解码时间?
  • RQ5与其他词级模型相比,不同子词单元(如正字法音节)在句子长度和解码效率方面表现如何?

主要发现

  • 使用堆栈弹出限制为1000的立方体剪枝,解码时间相比词级解码最高可减少19倍,BLEU分数仅轻微下降。
  • 空格标记和边界标记格式在解码速度和翻译准确率方面表现相似,ben-hin语对的BLEU分数分别为33.12和32.83。
  • 内部标记格式的翻译准确率较低(如ben-hin语对为30.10 BLEU),尽管解码时间相近,因此适用性较差。
  • 内部标记格式的相对解码时间最高(mal-hin语对为17.06倍),而空格和边界标记格式更高效(分别为7.68倍和7.44倍)。
  • 调优阶段也受益于这些优化,因为立方体剪枝和降低的堆栈弹出限制加快了解码器迭代速度,从而缩短了调优时间。
  • 翻译准确率与词级性能接近——例如,词级为31.62 BLEU,空格标记为33.12 BLEU(ben-hin语对)——表明质量损失极小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。