Skip to main content
QUICK REVIEW

[论文解读] A Probabilistic Translation Method for Dictionary-based Cross-lingual Information Retrieval in Agglutinative Languages

Javid Dadashkarimi, Azadeh Shakery|arXiv (Cornell University)|Nov 4, 2014
Natural Language Processing Techniques参考文献 23被引用 6
一句话总结

本文提出 MESC,一种用于黏着语如波斯语的词典基础跨语言信息检索(CLIR)的概率翻译方法。通过在单语语料库上使用最小编辑距离和基于二元语法频率的概率模型,生成词典条目的可能屈折形式,显著提升了英语-波斯语 CLIR 任务中的翻译准确率,优于先前方法。

ABSTRACT

Translation ambiguity, out of vocabulary words and missing some translations in bilingual dictionaries make dictionary-based Cross-language Information Retrieval (CLIR) a challenging task. Moreover, in agglutinative languages which do not have reliable stemmers, missing various lexical formations in bilingual dictionaries degrades CLIR performance. This paper aims to introduce a probabilistic translation model to solve the ambiguity problem, and also to provide most likely formations of a dictionary candidate. We propose Minimum Edit Support Candidates (MESC) method that exploits a monolingual corpus and a bilingual dictionary to translate users' native language queries to documents' language. Our experiments show that the proposed method outperforms state-of-the-art dictionary-based English-Persian CLIR.

研究动机与目标

  • 解决词典基础 CLIR 中词形丰富的语言存在的翻译歧义和未登录词(OOV)问题。
  • 克服波斯语等黏着语中缺乏可靠词干提取器的问题,因双语词典中常缺少完整的屈折形式。
  • 通过使用单语语料库和编辑距离,生成词典条目的合理词形,以提升 CLIR 性能。
  • 开发一种概率候选选择模型,利用查询词的上下文信息更准确地排序翻译结果。
  • 通过引入二元语法概率和支持候选,减少因选择低质量翻译导致的淹没效应。

提出的方法

  • 使用 Levenshtein 距离,通过寻找词典条目与单语语料库词之间的最小编辑操作,生成候选词形。
  • 通过最小编辑距离识别单语语料库中与词典条目相近的词,构建最小编辑支持候选(MESC)。
  • 应用基于规则的音译器处理未登录词,将非拉丁字符转换为其最近似的音素等价形式。
  • 利用候选翻译的二元语法概率构建概率翻译模型,以选择最符合上下文的术语。
  • 将 MESC 模型集成到 INQUERY 检索系统中,进行端到端的 CLIR 评估。
  • 使用覆盖度高的双语词典,以确保多样化的候选生成,且独立于排序或先前选择。

实验结果

研究问题

  • RQ1基于最小编辑距离和单语语料库的概率方法,能否提升黏着语中词典基础 CLIR 的翻译准确率?
  • RQ2通过编辑距离生成的支持候选,在多大程度上能减少歧义并提升检索性能?
  • RQ3二元语法概率的整合如何增强上下文中最优翻译的选择?
  • RQ4MESC 方法是否在英语-波斯语 CLIR 中优于现有的词典基础 CLIR 系统(如 INQUERY)和基于排名的方法?
  • RQ5缺失翻译和短语级复杂性如何影响 MESC 的性能?该方法能否缓解这些问题?

主要发现

  • 在 CLEF 2008 数据集上,MESC 的平均平均精度(MAP)达到 0.4449,相比波斯语词典基线提升了 25.7%。
  • 在 CLEF 2009 上,MESC 的 MAP 为 0.407,尽管部分主题增益较低,但仍比波斯语词典基线高出 6.1%。
  • 在所有测试词典中,MESC 的 MAP 均优于 INQUERY 系统,其中在 CLEF 2008 的波斯语词典上提升最高,达 +25.7%。
  • MESC 在 Precision@5 和 Precision@10 上的表现持续优于基线方法,尤其在 CLEF 2008 上表现更优,表明其排序质量更优。
  • 该方法在处理词形变化方面表现出强健性,MESC 生成支持候选的能力显著降低了因缺少屈折形式带来的影响。
  • 尽管在处理多部分翻译(如 'rail' 作为 'râh-âhn')方面存在局限,但 MESC 由于有效的二元语法建模和候选选择,性能依然强劲。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。