Skip to main content
QUICK REVIEW

[论文解读] Machine Transliteration

Kevin Knight, Jonathan Graehl|ArXiv.org|Apr 14, 1997
Natural Language Processing Techniques被引用 7
一句话总结

本文提出了一种用于逆向音译的机器学习方法——将音译的外文姓名(例如日语的'konpyuutaa')还原为其原始源语言形式(例如英语的'computer')。该方法采用多阶段的生成模型,包括音素分割、音素映射和语言建模,相较于基线方法在从音译文本重建源形式方面取得了显著改进。

ABSTRACT

It is challenging to translate names and technical terms across languages with different alphabets and sound inventories. These items are commonly transliterated, i.e., replaced with approximate phonetic equivalents. For example, "computer" in English comes out as "konpyuutaa" in Japanese. Translating such items from Japanese back to English is even more challenging, and of practical interest, as transliterated items make up the bulk of text phrases not found in bilingual dictionaries. We describe and evaluate a method for performing backwards transliterations by machine. This method uses a generative model, incorporating several distinct stages in the transliteration process.

研究动机与目标

  • 解决多语言文本中常见的音译姓名翻译回其原始源语言形式的挑战。
  • 开发一种能够执行逆向音译的系统,即将一种语言中的音译形式(例如日语)映射到其源语言对应形式(例如英语)。
  • 通过结构化、分阶段的生成方法,对音译拼写与源语言姓名之间复杂的非双射映射关系进行建模。
  • 在真实世界数据上评估该方法,其中音译术语主导了双语词典中的未登录词(OOV)空间。
  • 通过将音译视为首要问题,提升机器翻译和信息检索系统中文名重建的准确性。

提出的方法

  • 该方法采用将音译分解为若干阶段的生成模型:分割、音素映射和语言建模。
  • 利用分层结构对跨语言的音素片段及其映射关系进行建模,捕捉非线性的音素对应关系。
  • 模型引入语言模型对候选重建结果进行评分,优先选择在源语言中合理的形式。
  • 采用判别式评分函数,结合音素对齐似然和n-gram语言模型概率。
  • 系统在音译姓名及其源形式的平行数据上进行训练,使用最大似然估计进行参数学习。
  • 采用动态规划算法,解码给定音译输入下最可能的源语言形式。

实验结果

研究问题

  • RQ1生成模型能否有效从目标语言的音译形式中重建出源语言姓名?
  • RQ2与简单的基线方法相比,分阶段方法(分割、音素映射和语言建模)的性能如何?
  • RQ3该模型在未见的OOV姓名上具有多强的泛化能力?
  • RQ4引入语言模型对重建源语言形式的质量有何影响?
  • RQ5该方法对不同音译系统中拼写和音素表示的差异具有多强的鲁棒性?

主要发现

  • 所提出的生成模型在从音译形式重建源语言姓名方面显著优于基线方法。
  • 分阶段方法(分离处理分割、音素映射和语言建模)带来了更准确且更鲁棒的重建结果。
  • 引入语言模型有助于筛选出更合理的源语言形式,减少错误重建。
  • 该系统在测试数据上显著降低了错误率,尤其在具有复杂音素映射的姓名上表现突出。
  • 该方法在未见姓名上表现出强大的泛化能力,适用于机器翻译和信息检索等真实世界应用。
  • 结果证实,将音译建模为结构化、多阶段过程,相比整体式或启发式方法,性能更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。