Skip to main content
QUICK REVIEW

[论文解读] A Deep Neural Network Approach To Parallel Sentence Extraction

Francis Grégoire, Philippe Langlais|arXiv (Cornell University)|Sep 28, 2017
Natural Language Processing Techniques参考文献 15被引用 18
一句话总结

本文提出一种基于孪生双向RNN(BiRNN)的端到端深度神经网络方法,采用LSTM/GRU单元从可比单语语料中提取并行句子对,无需人工特征工程。该方法在强基线模型基础上实现显著性能提升,当使用维基百科语料提取的并行句子对增强统计机器翻译系统时,BLEU得分提升4.7分。

ABSTRACT

Parallel sentence extraction is a task addressing the data sparsity problem found in multilingual natural language processing applications. We propose an end-to-end deep neural network approach to detect translational equivalence between sentences in two different languages. In contrast to previous approaches, which typically rely on multiples models and various word alignment features, by leveraging continuous vector representation of sentences we remove the need of any domain specific feature engineering. Using a siamese bidirectional recurrent neural networks, our results against a strong baseline based on a state-of-the-art parallel sentence extraction system show a significant improvement in both the quality of the extracted parallel sentences and the translation performance of statistical machine translation systems. We believe this study is the first one to investigate deep learning for the parallel sentence extraction task.

研究动机与目标

  • 为解决多语言NLP中的数据稀疏性问题,通过自动从大规模可比语料中提取高质量并行句子对。
  • 消除现有并行句子对提取系统中对手工特征和多模型的依赖。
  • 开发一种可端到端训练的深度学习框架,直接从原始句子对中学习句子级别的翻译等价性。
  • 在非领域可比语料(如维基百科文章)上评估该方法的有效性,及其对下游统计机器翻译系统的影响。
  • 证明通过深度神经网络生成的连续句子嵌入可优于传统基于特征的方法,在并行句子对提取任务中表现更优。

提出的方法

  • 采用孪生双向循环神经网络(BiRNN)架构,将源语言和目标语言句子编码为连续向量表示。
  • 模型使用LSTM或GRU激活函数,以捕捉可变长度句子中的长距离依赖关系。
  • 通过比较编码表示之间的余弦相似度来判断句子对是否具有翻译等价性。
  • 使用对比损失函数并结合随机负样本,对模型进行端到端训练,以区分并行与非并行句子对。
  • 该方法仅依赖原始句子对,无需外部资源(如词对齐、双语词典或元数据)。
  • 通过从维基百科文章中提取句子对,并将其整合到统计机器翻译的并行训练集中,对模型进行评估。

实验结果

研究问题

  • RQ1深度神经网络能否在无需显式特征工程或外部语言资源的情况下,识别并行句子对?
  • RQ2与最先进的基于特征的系统相比,端到端深度学习模型在并行句子对提取任务中的表现如何?
  • RQ3所提取的并行数据在多大程度上提升了下游统计机器翻译系统的性能?
  • RQ4当在Europarl上训练、在维基百科文章上测试时,模型对领域偏移的鲁棒性如何?
  • RQ5模型是否能在不重新训练的情况下,泛化到不同语言对和不同领域?

主要发现

  • 当使用从维基百科中提取的198万个句子对进行训练时,所提出的BiRNN模型相比基线SMT系统,BLEU得分提升4.7分。
  • 即使仅使用得分最高的50万个句子对,基于BiRNN的系统仍达到25.0的BLEU分数,比基线系统高出0.1分。
  • 该模型共提取出1,987,769对并行句子对,远超基线系统,且在最高排名句子对中存在77%的重叠,表明提取质量较高。
  • 该方法优于基于Munteanu和Marcu(2005)以及Smith等人(2010)的强基线系统,显示出在句子对提取任务中更高的精确率与召回率。
  • 模型在分布外数据上表现出强泛化能力,这从尽管存在从Europarl到维基百科的领域差异,但新测试2013(newstest2013)性能仍提升可得证。
  • 本研究首次将深度学习应用于并行句子对提取任务,建立了端到端、无特征学习句子级别翻译等价性的新基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。