QUICK REVIEW
[论文解读] PRIME: A System for Multi-lingual Patent Retrieval
Shigeto Higuchi, Masatoshi Fukui|ArXiv.org|Jun 24, 2002
Biomedical Text Mining and Ontologies参考文献 20被引用 6
一句话总结
PRIME 是一个支持多语言的专利检索系统,使日文和英文用户能够使用单语查询检索双语专利数据库。该系统将查询翻译为目标语言,检索相关多语言专利,通过聚类和文档翻译提升浏览效率,并通过加权 Dice 系数计算共现得分,从日英专利族中提取短语级翻译,以扩展翻译词典,得分阈值为 5.0 时准确率达到 67.4%。
ABSTRACT
Given the growing number of patents filed in multiple countries, users are interested in retrieving patents across languages. We propose a multi-lingual patent retrieval system, which translates a user query into the target language, searches a multilingual database for patents relevant to the query, and improves the browsing efficiency by way of machine translation and clustering. Our system also extracts new translations from patent families consisting of comparable patents, to enhance the translation dictionary.
研究动机与目标
- 解决用户在检索外文专利数据库时面临的跨语言检索挑战。
- 开发一种系统,能够根据单语查询同时检索多种语言的相关专利。
- 通过机器翻译和检索结果的文档聚类,提升多语言专利检索结果的浏览效率。
- 通过从双语专利族中自动提取新的短语级翻译,扩展翻译词典。
- 评估一种半自动方法从可比专利对中提取翻译的准确率与成本效益。
提出的方法
- 系统使用查询翻译模块,利用双语词典和概率消歧技术将用户查询翻译为目标语言,同时保留技术术语的词序。
- 文档检索模块使用原始查询和翻译后查询在双语专利集合中搜索,以检索日文或英文的相关文档。
- 文档翻译模块仅将外文文档翻译成用户语言,以支持可读性。
- 聚类模块将检索到的文档划分为主题聚类,以提升浏览效率。
- 离线翻译提取模块使用形态分析和词性规则,从专利族的标题和摘要字段中识别日英短语对。
- 系统使用加权 Dice 系数计算关联得分:$\text{score}(W_j,W_e) = \log F_{je} \cdot \frac{2F_{je}}{F_j + F_e}$,以对翻译进行排序并选择高置信度翻译。
实验结果
研究问题
- RQ1多语言专利检索系统能否有效利用单语查询在日文和英文之间检索相关专利?
- RQ2文档聚类和机器翻译在多语言专利检索结果中如何提升浏览效率?
- RQ3能否利用专利族自动提取高质量的短语级翻译,以改进翻译词典?
- RQ4在使用评分阈值提取翻译时,精确率与召回率之间的权衡如何?
- RQ5半自动方法在多大程度上能减少构建专利检索双语词典所需的人工工作量?
主要发现
- 系统能够成功响应单语查询,返回多语言专利,使用户能够以母语访问相关文档。
- 聚类和文档翻译的结合显著提升了检索结果的可用性与浏览效率。
- 翻译提取方法从 32,000 个专利族中生成了 37,669 个候选翻译,经人工评估后确认正确者为 5,879 个。
- 在得分阈值为 5.0 时,该方法准确率达到 67.4%,表明高分翻译具有高精确率。
- 评估 37,669 个翻译仅耗时四人天,表明该方法具有低成本、可扩展的词典扩展潜力。
- 加权 Dice 系数有效过滤了低频和噪声共现,提升了提取准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。