Skip to main content
QUICK REVIEW

[论文解读] Identifying Word Translations in Non-Parallel Texts

Reinhard Rapp|ArXiv.org|May 22, 1995
Natural Language Processing Techniques参考文献 5被引用 17
一句话总结

本文提出一种方法,通过利用跨语言的相关共现模式,从非平行文本中识别词对翻译。基于单语语料库生成的共现矩阵,通过最大化矩阵间相似性的置换操作对词对进行对齐,即使在无关的英文与德文文本中也表现出强相关性,从而实现无需平行语料的翻译发现。

ABSTRACT

Common algorithms for sentence and word-alignment allow the automatic identification of word translations from parallel texts. This study suggests that the identification of word translations should also be possible with non-parallel and even unrelated texts. The method proposed is based on the assumption that there is a correlation between the patterns of word co-occurrences in texts of different languages.

研究动机与目标

  • 开发一种在非平行或无关文本中识别词翻译的方法,避免依赖对齐的双语语料库。
  • 探究当文本并非彼此翻译时,不同语言中文词共现模式是否仍存在相关性。
  • 仅使用单语语料库实现自动翻译发现,减少对昂贵平行文本集合的依赖。
  • 为构建多语言词汇资源及支持翻译辅助工具提供基础,而无需依赖句子级别的平行对。

提出的方法

  • 通过在单语语料库中统计11个词窗口内的词对,构建两种语言的共现矩阵。
  • 对矩阵进行归一化处理,使所有条目之和等于矩阵单元格数,以确保可比性。
  • 使用相似性函数比较英文与德文共现矩阵,衡量其点模式对齐程度。
  • 对一个矩阵中的词序(如英文)进行置换,寻找与另一矩阵(如德文)相似性最大的排列,以指示可能的词翻译。
  • 评估三种矩阵加权公式:原始共现频率(f(i&j))、频率比(f(i&j)/(f(i)f(j)))以及类似卡方检验的改进度量(f(i&j)²/(f(i)f(j)))。
  • 采用基于置换的搜索方法,寻找使相似性函数最小化的词序,以指示最佳翻译对齐。

实验结果

研究问题

  • RQ1能否仅通过单语语料库中的共现模式,在非平行或无关文本中可靠地识别词翻译?
  • RQ2当文本非平行时,一种语言中翻译对的共现模式与另一种语言中的共现模式相关性在多大程度上成立?
  • RQ3当词序被置换以对齐可能的翻译对时,两种语言共现矩阵之间的相似性是否提高?
  • RQ4该方法是否能在无需句子级对齐的情况下实现高精度的词翻译识别?
  • RQ5不同的矩阵加权公式如何影响翻译发现的性能与可靠性?

主要发现

  • 在无关的英文与德文语料库中,共现模式之间存在强相关性,支持了该方法的核心假设。
  • 随着错误词对应关系数量的减少,共现矩阵之间的相似性单调增加,表明相似性度量可有效引导对齐。
  • 即使没有平行文本,该方法也能可靠地识别词翻译,表现为在最优置换下相似性曲线收敛至最小值。
  • 使用改进的类似卡方检验的度量(公式1)在最小化对齐矩阵间相似性差异方面表现最佳。
  • 相似性函数中存在深层局部极小值,表明存在多个局部最优解,因此需要采用多起点或基于锚点的搜索策略以提高鲁棒性。
  • 结果表明,语料的主题可比性比平行性对成功实现翻译发现更为关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。