Skip to main content
QUICK REVIEW

[论文解读] Why Not Simply Translate? A First Swedish Evaluation Benchmark for Semantic Similarity

Tim Isbister, Magnus Sahlgren|arXiv (Cornell University)|Sep 7, 2020
Topic Modeling参考文献 9被引用 6
一句话总结

本论文通过使用谷歌神经机器翻译(NMT)API 将英文 STS-B 数据集翻译为瑞典语,首次构建了瑞典语语义文本相似度的评估基准。尽管存在翻译瑕疵,如英语化表达和时态不一致,该基准仍可用于评估瑞典语文本表示方法,结果表明原生模型(如 KB/BERT)优于多语言模型,甚至简单的词袋模型结合支持向量机也能取得具有竞争力的性能(r=0.704)。

ABSTRACT

This paper presents the first Swedish evaluation benchmark for textual semantic similarity. The benchmark is compiled by simply running the English STS-B dataset through the Google machine translation API. This paper discusses potential problems with using such a simple approach to compile a Swedish evaluation benchmark, including translation errors, vocabulary variation, and productive compounding. Despite some obvious problems with the resulting dataset, we use the benchmark to compare the majority of the currently existing Swedish text representations, demonstrating that native models outperform multilingual ones, and that simple bag of words performs remarkably well.

研究动机与目标

  • 解决瑞典语语义文本相似度缺乏公开可用评估数据的问题。
  • 利用机器翻译构建一种低成本、可扩展的基准,用于评估瑞典语文本表示方法。
  • 比较多种瑞典语文本表示模型的性能,包括多语言模型和原生模型。
  • 评估翻译瑕疵对模型评估及下游应用的影响。
  • 证明简单模型(如词袋模型)在新基准上可实现优异性能。

提出的方法

  • 使用谷歌神经机器翻译(NMT)API 将英文 STS-B 数据集翻译为瑞典语。
  • 将翻译后的瑞典语句子对用作评估语义相似度模型的基准。
  • 评估一系列文本表示模型:fastText、BERT 变体(KB/BERT、AF/BERT)、XLM-R、LASER、LaBSE 和 SBERT。
  • 通过平均词向量(fastText、BERT)或使用上下文表示(LASER、LaBSE)计算句子嵌入。
  • 使用翻译后的数据训练监督模型(SBERT、微调后的 BERT),并采用余弦相似度或回归输出进行相似度评分。
  • 使用皮尔逊相关系数与人工标注的相似度分数对比来评估模型性能。

实验结果

研究问题

  • RQ1机器翻译的英文 STS-B 数据集在多大程度上可作为评估瑞典语语义相似度模型的有效基准?
  • RQ2原生瑞典语语言模型与多语言模型在瑞典语基准上的语义相似度性能表现如何比较?
  • RQ3翻译瑕疵(如英语化表达、时态不匹配、复合词使用)对模型评估有何影响?
  • RQ4简单、非上下文化的模型(如词袋模型结合支持向量机)是否能在新基准上实现具有竞争力的性能?
  • RQ5使用多语言模型(如 XLM-R 和 LaBSE)进行跨语言迁移在瑞典语 STS 基准上的效果如何?

主要发现

  • 尽管存在翻译瑕疵(如英语化表达和时态不一致),机器翻译生成的瑞典语 STS-B 基准仍可用于模型比较。
  • 在瑞典语数据上微调的原生瑞典语 BERT 模型(如 KB/BERT)表现最佳,皮尔逊相关系数达 0.782。
  • 简单词袋模型结合支持向量回归的皮尔逊相关系数为 0.704,表明其在计算成本极低的情况下仍具有强大竞争力。
  • 在无监督设置下,多语言模型中 LASER 表现最佳(r=0.714),而使用英文 STS-B 微调 SBERT 可将 XLM-R 的性能提升至 r=0.751。
  • 在瑞典语数据上对多语言模型进行微调可进一步提升性能,表明跨语言迁移具有显著价值。
  • 如时态错误或非常规词汇(如用 'tar fart' 表达 'taking off')等翻译错误,只要在句子对之间保持一致,就不会显著降低基准在模型比较中的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。