Skip to main content
QUICK REVIEW

[论文解读] Self-Organizing Machine Translation: Example-Driven Induction of Transfer Functions

Patrick Juola|ArXiv.org|Jun 3, 1994
Natural Language Processing Techniques被引用 3
一句话总结

本文提出了一种自组织机器翻译系统,通过一种新颖的*标记-正则形式*语法形式化方法,从双语句子对中推导出转移函数,并嵌入多变量优化框架中。该方法成功地从小规模语料中推导出英法和英乌转移函数,结果在语言学上合理且与隐马尔可夫模型基线相比具有竞争力的准确性。

ABSTRACT

With the advent of faster computers, the notion of doing machine translation from a huge stored database of translation examples is no longer unreasonable. This paper describes an attempt to merge the Example-Based Machine Translation (EBMT) approach with psycholinguistic principles. A new formalism for context- free grammars, called *marker-normal form*, is demonstrated and used to describe language data in a way compatible with psycholinguistic theories. By embedding this formalism in a standard multivariate optimization framework, a system can be built that infers correct transfer functions for a set of bilingual sentence pairs and then uses those functions to translate novel sentences. The validity of this line of reasoning has been tested in the development of a system called METLA-1. This system has been used to infer English->French and English->Urdu transfer functions from small corpora. The results of those experiments are examined, both in engineering terms as well as in more linguistic terms. In general, the results of these experiments were psycho- logically and linguistically well-grounded while still achieving a respectable level of success when compared against a similar prototype using Hidden Markov Models.

研究动机与目标

  • 开发一种机器翻译系统,能够直接从双语示例对中学习转移函数,避免依赖人工编码规则。
  • 通过使用与认知理论相容的形式化方法建模语言数据,将心理语言学原理整合到机器翻译中。
  • 使系统能够从少量平行语料中泛化,利用推导出的转移函数翻译新句子。
  • 评估推导出的转移函数在跨语言翻译任务中的语言学与工程有效性。
  • 在准确性和语言学合理性方面,将示例驱动系统的性能与基于隐马尔可夫模型的原型进行比较。

提出的方法

  • 该系统采用一种名为*标记-正则形式*的新形式化方法,这是一种旨在与语言处理心理语言学模型对齐的上下文无关语法变体。
  • 双语句子对以标记-正则形式表示,以编码语言之间的句法和语义对应关系。
  • 应用多变量优化框架,推导出将源语言结构映射到目标语言结构的最优转移函数。
  • 优化过程最小化基于示例句子对与推导出的转移规则之间对齐质量的损失函数。
  • 通过将学习到的转移函数应用于新出现的、未见过的句子对,实现系统泛化。
  • 该方法使用英法和英乌翻译任务的小型平行语料进行评估。

实验结果

研究问题

  • RQ1能否使用与心理语言学理论相容的形式化方法,从小型双语语料中有效推导出转移函数?
  • RQ2示例驱动的转移函数推导是否能产生语言学上合理且准确的翻译?
  • RQ3与基于隐马尔可夫模型的原型相比,该自组织系统的翻译准确度表现如何?
  • RQ4该系统在多大程度上能泛化到训练数据中未出现的新句式结构?
  • RQ5标记-正则形式形式化能否充分表示跨语言的句法与语义对应关系?

主要发现

  • 该系统成功地从小型平行语料中推导出英法和英乌的转移函数,证明了该方法的可行性。
  • 推导出的转移函数在语言学上具有坚实基础,反映了合理的句法与语义映射。
  • 该系统在定量评估中达到了令人满意的翻译成功率,与基于隐马尔可夫模型的原型相比具有可比性。
  • 使用标记-正则形式使得双语数据的表示比传统形式化方法更具认知合理性。
  • 优化框架有效平衡了准确度与泛化能力,使系统能够以合理保真度翻译新句子。
  • 结果表明,在低资源环境下,示例驱动的转移函数推导是规则方法或统计方法的可行替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。