Skip to main content
QUICK REVIEW

[论文解读] Intelligent Translation Memory Matching and Retrieval with Sentence Encoders

Tharindu Ranasinghe, Constantin Orǎsan|arXiv (Cornell University)|Apr 27, 2020
Natural Language Processing Techniques参考文献 22被引用 11
一句话总结

本文提出用句子编码器(特别是通用句子编码器)替代翻译记忆(TM)系统中传统的基于编辑距离的匹配方法,以提升语义相似但词汇不同的翻译片段的检索效果。该方法在识别语义相似的模糊匹配方面显著优于编辑距离,尤其在低相似度范围(0.6–0.8)表现突出,平均语义文本相似度得分为0.768,表明翻译效率得到提升。

ABSTRACT

Matching and retrieving previously translated segments from a Translation Memory is the key functionality in Translation Memories systems. However this matching and retrieving process is still limited to algorithms based on edit distance which we have identified as a major drawback in Translation Memories systems. In this paper we introduce sentence encoders to improve the matching and retrieving process in Translation Memories systems - an effective and efficient solution to replace edit distance based algorithms.

研究动机与目标

  • 解决编辑距离在捕捉翻译片段之间语义相似性方面的局限性。
  • 通过用基于深度学习的句子编码器替代编辑距离,提升翻译记忆系统中的模糊匹配检索效果。
  • 评估通用句子编码器是否能比传统方法检索到更多语义相关的翻译片段。
  • 评估句子编码器在低相似度范围中检索更佳匹配片段的潜力,以提升翻译效率。
  • 探索利用通用句子编码器的多语言版本将该方法扩展至多语言TM系统的可行性。

提出的方法

  • 使用通用句子编码器将源语言和目标语言片段嵌入为稠密向量表示。
  • 通过句子嵌入之间的余弦相似度计算片段间的语义相似度,替代编辑距离。
  • 检索翻译单元时依据最高语义相似度得分,而非词法重叠程度。
  • 采用人工标注的语义文本相似度(STS)得分作为黄金标准,在真实TM数据上评估该方法。
  • 将该系统与商业TM中常用的基于Okapi BM25的模糊匹配算法进行对比。
  • 实验基于英西语TM数据集展开,结果按模糊匹配得分范围进行分析。

实验结果

研究问题

  • RQ1像通用句子编码器这样的句子编码器能否比基于编辑距离的方法检索到更多语义相关的翻译片段?
  • RQ2在低模糊匹配分数范围(例如0.6–0.8)内,通用句子编码器的性能与传统TM匹配算法相比如何?
  • RQ3检索片段的语义相似度与人工标注的STS得分之间的相关性有多大?
  • RQ4通过在标准TM系统失效的情况下检索到更优匹配片段,句子编码器能否有效提升翻译效率?
  • RQ5通用句子编码器的多语言能力是否适合将此方法推广至非英语语种对?

主要发现

  • 通用句子编码器在检索语义相似片段方面优于基于编辑距离的方法,尤其在模糊匹配得分范围0.6–0.8内表现突出。
  • 在0.6–0.8模糊匹配范围内,由通用句子编码器检索到的片段平均语义文本相似度(STS)得分为0.768,表明其语义相关性极高。
  • 在模糊匹配得分低于0.8的范围内,通用句子编码器始终提供比基于Okapi的系统更优的匹配结果。
  • 在0.8–1.0得分范围内,该方法的平均STS得分为0.952,表明在高相似度情况下表现强劲。
  • 该方法在提升翻译效率方面具有潜力,因为它能检索到传统TM系统通常舍弃的范围内的可用匹配片段。
  • 结果表明,句子编码器可有效替代编辑距离,成为TM系统中核心相似度度量指标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。