Skip to main content
QUICK REVIEW

[论文解读] Robust Neural Machine Translation with Joint Textual and Phonetic Embedding

Hairong Liu, Mingbo Ma|arXiv (Cornell University)|Oct 15, 2018
Natural Language Processing Techniques参考文献 23被引用 4
一句话总结

本文提出一种联合文本与语音嵌入方法,以增强神经机器翻译(NMT)模型对同音词噪声的鲁棒性——即词语被语音上相似的替代词替换的情况。通过强调语音信息(β ≈ 0.95)并使用合成同音错误进行训练数据增强,该方法在噪声输入下显著提升了鲁棒性,且出人意料地提升了在干净测试集上的性能,在两种场景下均优于标准NMT模型。

ABSTRACT

Neural machine translation (NMT) is notoriously sensitive to noises, but noises are almost inevitable in practice. One special kind of noise is the homophone noise, where words are replaced by other words with similar pronunciations. We propose to improve the robustness of NMT to homophone noises by 1) jointly embedding both textual and phonetic information of source sentences, and 2) augmenting the training dataset with homophone noises. Interestingly, to achieve better translation quality and more robustness, we found that most (though not all) weights should be put on the phonetic rather than textual information. Experiments show that our method not only significantly improves the robustness of NMT to homophone noises, but also surprisingly improves the translation quality on some clean test sets.

研究动机与目标

  • 为解决NMT模型在同音词噪声下的脆弱性问题,即语音上相似的词语被替换,导致翻译错误。
  • 在不牺牲干净测试集性能的前提下提升鲁棒性,而这一点在鲁棒NMT研究中常被忽视。
  • 探究在同音词噪声下,语音信息是否可作为比文本输入更稳定的信号。
  • 评估使用合成同音错误进行数据增强在提升模型泛化能力方面的有效性。

提出的方法

  • 使用可学习的嵌入对文本单元和语音单元(如中文的拼音)进行联合嵌入。
  • 通过加权平均组合词嵌入与语音嵌入:π([a,ψ(a)]) = (1−β)π(a) + βπ(ψ(a)),其中β控制文本与语音信号之间的平衡。
  • 在实验中使用β ≈ 0.95,表明语音信息在最终表示中占主导地位,以实现最佳鲁棒性。
  • 通过在40%的训练句子对中随机用同音词替换源词,实现数据增强,使训练数据增至约280万对。
  • 使用联合嵌入层和增强数据训练基于Transformer的NMT模型,并在干净与噪声测试集上进行评估。
  • 在与词嵌入组合前,通过平均压缩语音单元嵌入为单一向量,避免使用复杂的RNN进行融合。

实验结果

研究问题

  • RQ1联合文本与语音嵌入能否在真实世界输入场景中提升NMT对同音词噪声的鲁棒性?
  • RQ2更多依赖语音信息而非文本输入,是否能带来更好的鲁棒性与泛化能力?
  • RQ3使用合成同音错误进行数据增强在多大程度上能提升模型的鲁棒性与在干净数据上的性能?
  • RQ4文本与语音嵌入之间的平衡(由β控制)如何影响翻译质量与抗噪声能力?

主要发现

  • 当β = 0.95时,模型表现最佳,表明在同音词噪声下,语音信号比文本信号更具鲁棒性。
  • 在NoisySet1和NoisySet2测试集上,所提方法分别取得45.71和42.66的BLEU分数,显著优于基线Transformer模型(41.33和37.11)。
  • 经过数据增强后,模型在干净测试集(NIST 06)上的BLEU分数从45.97提升至48.06,表明噪声数据有助于模型泛化。
  • 该方法成功将包含同音替换(有 → 又)的句子正确翻译,而基线模型则生成了无关输出(如将'have'误译为'hpv')。
  • 即使在干净测试集上,采用联合嵌入与数据增强的模型也优于基线模型,表明鲁棒性训练可整体提升性能。
  • 消融实验确认,语音信息在抗噪声鲁棒性方面比文本信息更为关键,β接近1时达到最优结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。