Skip to main content
QUICK REVIEW

[论文解读] Noun Phrase Reference in Japanese-to-English Machine Translation

Francis Bond, Kentaro Ogura|ArXiv.org|Jan 23, 1996
Natural Language Processing Techniques参考文献 14被引用 19
一句话总结

本文提出在日语到英语的机器翻译中,对名词短语的通用用法、指代用法和属性描述用法进行三元区分,以改进冠词和数词的生成。通过基于句法和语义线索(如系动词、定指标记和上下文)的启发式方法,该方法将 ALT-J/E 系统中文冠词和数词的正确率从 65% 提高到 77%,通过进一步的规则优化,有望将准确率提升至 84%。

ABSTRACT

This paper shows the necessity of distinguishing different referential uses of noun phrases in machine translation. We argue that differentiating between the generic, referential and ascriptive uses of noun phrases is the minimum necessary to generate articles and number correctly when translating from Japanese to English. Heuristics for determining these differences are proposed for a Japanese-to-English machine translation system. Finally the results of using the proposed heuristics are shown to have raised the percentage of noun phrases generated with correct use of articles and number in the Japanese-to-English machine translation system ALT-J/E from 65% to 77%.

研究动机与目标

  • 解决日语到英语机器翻译中冠词和数词生成错误的问题。
  • 通过区分名词短语的三种指代用法(通用、指代、属性描述)来提升英语输出质量。
  • 开发一种基于句法和语义线索的启发式算法,用于分类日语句子中名词短语的指代类型。
  • 评估该分类对 ALT-J/E 机器翻译系统中文冠词和数词生成的影响。
  • 识别并缓解名词短语生成中的错误来源,特别是因参考分类不足导致的问题。

提出的方法

  • 该方法将名词短语划分为三类:通用(指代一类事物)、指代(指代特定实体)和属性描述(通过系动词描述属性)。
  • 利用句法标记(如主题助词(wa)、宾格助词(o)、所有格助词(no))推断指代类型。
  • 算法基于动词类型(尤其是系动词如 'da')应用启发式规则,以检测属性描述用法。
  • 通过上下文(包括先前提及、量词和修饰语)确定定指性,以指导冠词选择。
  • 将分类结果整合到生成阶段,以选择适当的冠词(a/an/the)和单复数形式。
  • 错误分析识别出主要故障源:词典缺失(20%)、数字表达翻译(12%)以及缺乏上下文推理(如间接回指)。

实验结果

研究问题

  • RQ1如何在日语中对名词短语的指代进行通用、指代和属性描述三类区分,以提升英语冠词和数词的生成质量?
  • RQ2日语句子中哪些句法和语义线索能够可靠地区分这三种指代类型?
  • RQ3在日语到英语机器翻译系统中,引入这种三元区分能在多大程度上提高冠词和数词生成的准确性?
  • RQ4名词短语生成中的主要错误来源是什么?如何通过基于规则的改进来缓解这些问题?
  • RQ5所提出的 方法能否扩展至处理孤立句子之外的连贯文本段落?

主要发现

  • 所提方法使 ALT-J/E 系统中文冠词和数词正确生成的名词短语比例从 65% 提高到 77%。
  • 名词短语指代分类的成功率达到 74%,而可数性与数词生成的准确率达 85%。
  • 通过解决词典缺失(20%)和生成规则缺陷(8%),预计可将错误减少高达 30%,潜在成功率可提升至 84%。
  • 该方法有效防止了因缺乏属性描述类别而引发的过度定指化错误,例如 Murata(1993b)的系统中曾出现的问题。
  • 该算法在扩展至更大语料库方面显示出潜力,但需在更广泛的文本类型上进行测试,以确保覆盖范围和可复现性。
  • Knight 和 Chander(1995)的后编辑方法不适用于机器翻译输出,因其依赖于预先已知的冠词位置,限制了其实际应用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。