Skip to main content
QUICK REVIEW

[论文解读] Applying a Hybrid Query Translation Method to Japanese/English Cross-Language Patent Retrieval

Masatoshi Fukui, Shigeto Higuchi|ArXiv.org|Jun 24, 2002
Semantic Web and Ontologies参考文献 15被引用 6
一句话总结

本文提出了一种用于日语/英语跨语言专利用检索的混合查询翻译方法,结合多种词典与二元语法统计以解决翻译歧义。该方法在平均精确率上达到了单语检索性能的76%,表明歧义消解显著提升了基于简单词典方法的跨语言专利用检索效果。

ABSTRACT

This paper applies an existing query translation method to cross-language patent retrieval. In our method, multiple dictionaries are used to derive all possible translations for an input query, and collocational statistics are used to resolve translation ambiguity. We used Japanese/English parallel patent abstracts to perform comparative experiments, where our method outperformed a simple dictionary-based query translation method, and achieved 76% of monolingual retrieval in terms of average precision.

研究动机与目标

  • 通过混合查询翻译方法提升日语与英语之间跨语言专利用检索的性能。
  • 评估在技术专利用检索场景中消解翻译歧义的有效性。
  • 比较基于词典的翻译与使用二元语法统计消解歧义的性能差异。
  • 评估跨语言检索性能在多大程度上接近单语检索性能,特别是在专利用信息检索领域。

提出的方法

  • 系统使用EDR技术词典与通用词典,为查询词生成所有可能的翻译。
  • 未列出的词汇通过音译处理,生成目标语言的音似等价形式。
  • 利用NACSIS语料库中的二元语法统计,通过选择最可能的翻译组合来消解翻译歧义。
  • 检索引擎采用向量空间模型,并使用TF·IDF加权进行文档排序。
  • 英文文档通过WordNet进行分词、停用词去除与词形还原;日文文档使用ChaSen形态分析器进行分词。
  • 基于查询与文档向量之间的余弦相似度检索相关文档,必要时可使用机器翻译提高可读性。

实验结果

研究问题

  • RQ1使用二元语法统计消解翻译歧义是否能提升跨语言专利用检索性能?
  • RQ2在日语/英语专利用检索中,混合查询翻译方法的性能与简单基于词典的方法相比如何?
  • RQ3在专利用领域,跨语言检索性能在多大程度上接近单语检索性能?
  • RQ4来自不同语料库(NACSIS)的二元语法统计能否有效提升在较小目标语料库(JAPIO)中的翻译质量?

主要发现

  • 采用歧义消解的混合方法(JEDIS)在平均精确率上达到了单语日文检索(JJ)的76%,显著提升了性能。
  • 仅使用基于词典翻译的方法(JEALL)达到了单语性能的65.26%,证实了歧义消解的优势。
  • 在所有召回率水平上,JEDIS方法均优于JEALL,表明二元语法统计能有效减少翻译歧义。
  • 尽管专利用技术术语具有挑战性,该系统的性能与现有CLIR系统在新闻与技术摘要语料库中的表现相当。
  • 在k-best翻译选择中,k=1时性能最佳,表明高精度的单一翻译比多个候选翻译更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。