Skip to main content
QUICK REVIEW

[论文解读] Improving Multilingual Semantic Textual Similarity with Shared Sentence Encoder for Low-resource Languages

Xin Tang, Shanbo Cheng|arXiv (Cornell University)|Oct 20, 2018
Topic Modeling参考文献 24被引用 6
一句话总结

本文提出了一种多语言共享句子编码框架,通过双向翻译预训练任务,利用丰富的资源语言(如英语)数据,提升了西班牙语、阿拉伯语、泰语和印度尼西亚语等低资源语言的语义文本相似度(STS)性能。该方法通过共享编码器生成多种语言特定的句子表示,并通过集成模型实现更优的相似度预测,其性能优于非MT类最先进方法,并在SemEval和工业级口语语言数据上达到与MT方法相当的水平。

ABSTRACT

Measuring the semantic similarity between two sentences (or Semantic Textual Similarity - STS) is fundamental in many NLP applications. Despite the remarkable results in supervised settings with adequate labeling, little attention has been paid to this task in low-resource languages with insufficient labeling. Existing approaches mostly leverage machine translation techniques to translate sentences into rich-resource language. These approaches either beget language biases, or be impractical in industrial applications where spoken language scenario is more often and rigorous efficiency is required. In this work, we propose a multilingual framework to tackle the STS task in a low-resource language e.g. Spanish, Arabic , Indonesian and Thai, by utilizing the rich annotation data in a rich resource language, e.g. English. Our approach is extended from a basic monolingual STS framework to a shared multilingual encoder pretrained with translation task to incorporate rich-resource language data. By exploiting the nature of a shared multilingual encoder, one sentence can have multiple representations for different target translation language, which are used in an ensemble model to improve similarity evaluation. We demonstrate the superiority of our method over other state of the art approaches on SemEval STS task by its significant improvement on non-MT method, as well as an online industrial product where MT method fails to beat baseline while our approach still has consistently improvements.

研究动机与目标

  • 解决低资源语言语义文本相似度(STS)中标注数据稀缺的挑战。
  • 克服现有MT方法的局限性,包括非正式文本中翻译质量下降以及实时系统中延迟较高的问题。
  • 开发一种通用且高效的框架,利用丰富的资源语言数据,无需语言特定特征或预处理。
  • 通过共享多语言编码器生成多种语言特定的句子表示,提升低资源语言的STS性能。
  • 在公共基准(SemEval)和真实工业应用的口语语言场景中,验证该框架的有效性。

提出的方法

  • 使用大规模单语和多语言语料库中的双向机器翻译任务,对共享多语言编码器进行预训练。
  • 模型采用共享的基于Transformer的编码器和共享解码器,适用于源语言和目标语言,实现跨语言对齐。
  • 引入自翻译作为去噪自编码器式的目标,以在预训练过程中保持语义完整性。
  • 对于每个输入句子,通过在前面添加语言标记,生成不同语言特定语义空间中的多种表示。
  • 通过共享的多层感知机(MLP)集成模型,结合这些多语言表示,以预测句子相似度。
  • 该框架在来自丰富资源语言和低资源语言的标注STS数据上进行微调,无需语言特定特征或预处理。

实验结果

研究问题

  • RQ1在翻译任务上预训练的共享多语言句子编码器,能否提升低资源语言的STS性能?
  • RQ2在低资源STS设置下,所提出方法与非MT和MT基线方法相比表现如何?
  • RQ3通过共享编码器生成多种语言特定的句子表示,是否能增强相似度评估性能?
  • RQ4该框架在MT质量下降的非正式和口语语言输入中,能否保持高性能?
  • RQ5在多语言数据上进行预训练,能在多大程度上提升零样本或少样本STS性能?

主要发现

  • 在SemEval 2017西班牙语(es-es)任务中,当使用英语和西班牙语数据及多语言表示进行微调时,模型的Spearman相关系数达到0.825,显著优于非MT基线方法。
  • 仅使用西班牙语训练数据时,模型在预训练后Spearman相关系数从0.188提升至0.727,表现出强大的少样本泛化能力。
  • 该方法在SemEval上优于非MT类最先进方法,并在西班牙语和阿拉伯语配对中达到与MT方法相当的性能。
  • 在泰国语和印度尼西亚语口语语言数据的工业部署中,该模型持续优于MT基线方法,后者在此设置下甚至未能超越基线。
  • 即使标注数据极少,预训练也显著提升了性能,表明多语言表示学习在低资源场景下非常有效。
  • 消融实验证实,预训练以及多语言表示的引入对性能提升至关重要,尤其在低资源设置中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。